В оценке агентов недостаточно удалить подозрительные примеры и пров... - Vibeus
В оценке агентов недостаточно удалить подозрительные примеры и проверить, что задачи в принципе решаемы. Сначала каждому нулю нужна причина.
Непроходимая задача, сломанный инструмент, неоднозначный критерий и реальная ошибка агента в итоговой таблице выглядят одинаково. Но требуют совершенно разных изменений. Если этого не разметить, можно очистить набор, поднять метрику и получить ложное ощущение прогресса - просто потому, что из оценки исчезли неудобные случаи.
Качество данных начинается не с удаления плохих примеров, а с понимания, почему именно они стали плохими.