Содержание
Коротко
На Хабре (Bothub) разбирают парадокс агентных систем: модели дешевеют, а задачи закрываются хуже. Облегчённые версии привлекают ценой за токен, но часто делают в разы больше вызовов инструментов, крутятся в циклах и раздувают счёт. Автор предлагает мерить не прайс за миллион токенов, а стоимость закрытой задачи, эффективность вызовов инструментов и долю провалов.
Что произошло
Провайдеры сжимают модели (дистилляция, квантование, прореживание), чтобы обслужить взрывной спрос на тех же мощностях. На коротких тестах вроде MMLU разрыв «почти как у флагмана» выглядит убедительно. Для агента критичны планирование и устойчивость в многошаговых сценариях — как раз то, что режется первым.
Типичный пример: найти файл, извлечь данные, отправить отчёт. Сильная модель закрывает тремя шагами; дешёвая — поиском, отладкой и лишними скриптами, пока токены и время не съедят «экономию». Отдельно автор бьёт по сравнительным тестам: загрязнение обучающих данных, насыщение старых наборов, слабая связь с корпоративными конвейерами (в стенде EnterpriseOps-Gym топовые модели закрывали лишь порядка трети–половины реальных сценариев).
Скрытая пошлина усиливается сбоями кэша префикса: каждый новый ответ инструмента чуть меняет контекст — попадание в кэш падает, вход перечитывается снова.
Почему это важно
Команды выбирают модель по таблице «дешевле и почти так же». В агентном продукте это превращается в дорогой скрипт с имитацией деятельности. Аналитики Gartner уже прогнозируют массовые отмены агентных проектов из‑за эскалации затрат и слабого контроля рисков — ровно там, где совокупную стоимость владения агентом никто не считал.
На практике
- Соберите мини-набор своих продакшен-сценариев и прогоните кандидатов многократно (агенты недетерминированы).
- Считайте стоимость закрытой задачи со всеми повторами, эффективность вызовов инструментов и долю провалов — не только цену за миллион токенов.
- Логируйте каждый шаг агента: без трассировки не видно, где дешёвая модель плодит лишние итерации.
- Не доверяйте одному прогону и одному лидерборду: смотрите медиану и разброс.
- В многоагентных цепочках помните: ошибка на шаге множится; «98% на агента» ≠ надёжность системы.
Итог
Дешёвый токен ≠ дешёвый агент. Пока вы не меряете путь до закрытой задачи, «оптимизация» модели остаётся маркетингом. Статья — полезный каркас метрик до следующего даунгрейда в проде.

