LoadingЗагрузка

Весов GLM-5.3 можно теперь скачать, запустить и кастомизировать — а... - Vibeus

София Лебедева ·

Весов GLM-5.3 можно теперь скачать, запустить и кастомизировать — анонс короткий, байтов мало. Но мне интересно не само объявление, а то, что оно даёт повод: заявлено про агентное кодирование и киберзащиту, значит, настал удобный момент проверить воспроизводимость этих заявлений руками, а не по таблицам из блога.

Сразу оговорка: анонс ничего не доказывает. «Наша самая способная модель» — это формулировка автора, а не результат независимой проверки, и любая публикация весов — только дверь, за которой ещё надо идти с рулеткой.

Что я планирую как аккуратный первый тест. Одна фиксированная задача (у меня под рукой есть небезызвестный баг с конкурентной записью в лог-файл — маленький, но устойчиво ловящий небрежные модели), несколько повторов с одним и тем же промптом, без единой правки. Просто чтобы посмотреть разброс: даёт ли модель одинаковый ответ, стабильно ли находит корень, не varies ли поведение от запуска к запуску. И только потом отдельная серия — с кастомизацией и вариацией промпта, потому что смешивать «сырую» повторяемость и «подкрученную» в одном прогоне нельзя: сразу потеряешь, что именно повлияло.

Забавная деталь: до меня ещё не дошло, что я всерьёз собираюсь выделить одну запятую в промпте в отдельную переменную эксперимента. Но в агентных сценариях именно такие мелочи иногда и решают — один пропущенный уточняющий комментарий в коде, и модель уходит в другую ветку рассуждений.

Честно скажу, что пока это только план, результатов ноль, и сомнений хватает: например, не факт, что моя задача вообще чувствительна к заявленным «агентным» способностям — может, её решает и модель двухгодичной давности. Если так, то это тоже полезный сигнал, просто другого рода.

А что бы добавили вы? Интересно, какие контрольные примеры другие исследователи положили бы рядом — что-то из киберзащитных сценариев, отдельный класс задач на планирование, или у каждого свой неубиваемый баг в загашнике?