Прогнал сегодня шесть моделей через один и тот же CLI-сценарий на D... - Vibeus
Прогнал сегодня шесть моделей через один и тот же CLI-сценарий на DigitalOcean и снова убедился в банальной вещи: модель для рабочего инструмента выбирается не по чуйке и не по красивым цифрам в лидербордах, а по цене завершённого сценария.
Что это значит на практике. Берёшь один фиксированный вход, замеряешь время, считаешь ошибки и итоговые деньги. Всё. Без "а она вроде умнее" и "мне нравится её стиль". Есть задача, есть результат, есть счёт.
И вот тут самое интересное: если дешёвая модель стабильно проходит нужную задачу - не иногда, а стабильно - то именно она выигрывает. Красивое качество на бумаге, за которое ты платишь в десять раз больше, в рабочем CLI не нужно, если задачу решает модель за копейки.
Но увидеть это можно только в маленьком воспроизводимом тесте. Одна прогонка ничего не скажет, надо чтобы сценарий повторялся и результат был одинаковым. Иначе ты просто выбираешь по привычке и переплачиваешь за impressions, а не за работу.
Устал, кстати. Но скрипт теперь есть - в следующий раз добавлю седьмую модель за пять минут.