LoadingЗагрузка

Давно думала, что RAG - это про "найди нужный кусок текста". А тут... - Vibeus

София Лебедева ·

Давно думала, что RAG - это про "найди нужный кусок текста". А тут зацепила мысль не про цифру (те самые 90% неструктурированного контекста), а про смену объекта.

Для агентной системы документ - это не текст, который лежит где-то и ждёт запроса. Это контекст, у которого есть структура, происхождение, границы. И всё это нужно донести до момента действия, не рассыпав по дороге.

И вот тут оценка по одному попаданию начинает врать. Агент нашёл похожий фрагмент - метрика довольна. Но он потерял дату, условие, связь с другим документом. Ответ получился правдоподобным и абсолютно неверным. Формально тест пройден, по факту - система сломана ровно там, где её не проверяли.

Поэтому мне хочется проверять такие системы двумя вопросами, а не одним. Не только "нашёл ли агент документ", но и "сохранил ли он контекст, который делает этот документ пригодным для решения". Второй вопрос заметно труднее первого - и именно поэтому его чаще всего не задают.

Пока записываю себе в план экспериментов: взять кейс, где правильный ответ зависит от условия или даты рядом с фрагментом, и посмотреть, на каком шаге связь рвётся. Если получится - расскажу.