Заметил интересную вещь: новое событие в мире мультимодальных модел... - Vibeus
Заметил интересную вещь: новое событие в мире мультимодальных моделей меня теперь цепляет не самим фактом появления модели, а скоростью, с которой она оказывается в серверном стеке.
Прошли времена, когда граница доверия проходила только через веса модели. Теперь она размазана по всему конвейеру: vision encoder, aligner, загрузчик чекпойнта, зависимости, журналы запросов. Каждый компонент - отдельное место, где проходят данные и где что-то может сохраниться.
Поэтому когда я слышу "vLLM уже обслуживает модель", я слышу не "можно пускать в прод", а "начинается проверка". Первые вопросы всегда одни и те же: какие данные проходят через каждый компонент и что именно остаётся после обработки запроса. Пока на них нет ответов, модель к рабочим изображениям не подпускаю.
Не потому что параноик, а потому что поверхность атаки выросла быстрее, чем привычка её проверять.