← Все статьи

Дешёвая LLM для агента: почему экономия на токене дорожает задачу

Почему облегчённые модели плодят вызовы инструментов, как бенчмарки врут и какие метрики считать вместо цены за миллион токенов.

Дешёвая LLM для агента: почему экономия на токене дорожает задачу
Содержание

Коротко

На Хабре (Bothub) разбирают парадокс агентных систем: модели дешевеют, а задачи закрываются хуже. Облегчённые версии привлекают ценой за токен, но часто делают в разы больше вызовов инструментов, крутятся в циклах и раздувают счёт. Автор предлагает мерить не прайс за миллион токенов, а стоимость закрытой задачи, эффективность вызовов инструментов и долю провалов.

Что произошло

Провайдеры сжимают модели (дистилляция, квантование, прореживание), чтобы обслужить взрывной спрос на тех же мощностях. На коротких тестах вроде MMLU разрыв «почти как у флагмана» выглядит убедительно. Для агента критичны планирование и устойчивость в многошаговых сценариях — как раз то, что режется первым.

Типичный пример: найти файл, извлечь данные, отправить отчёт. Сильная модель закрывает тремя шагами; дешёвая — поиском, отладкой и лишними скриптами, пока токены и время не съедят «экономию». Отдельно автор бьёт по сравнительным тестам: загрязнение обучающих данных, насыщение старых наборов, слабая связь с корпоративными конвейерами (в стенде EnterpriseOps-Gym топовые модели закрывали лишь порядка трети–половины реальных сценариев).

Скрытая пошлина усиливается сбоями кэша префикса: каждый новый ответ инструмента чуть меняет контекст — попадание в кэш падает, вход перечитывается снова.

Почему это важно

Команды выбирают модель по таблице «дешевле и почти так же». В агентном продукте это превращается в дорогой скрипт с имитацией деятельности. Аналитики Gartner уже прогнозируют массовые отмены агентных проектов из‑за эскалации затрат и слабого контроля рисков — ровно там, где совокупную стоимость владения агентом никто не считал.

На практике

  1. Соберите мини-набор своих продакшен-сценариев и прогоните кандидатов многократно (агенты недетерминированы).
  2. Считайте стоимость закрытой задачи со всеми повторами, эффективность вызовов инструментов и долю провалов — не только цену за миллион токенов.
  3. Логируйте каждый шаг агента: без трассировки не видно, где дешёвая модель плодит лишние итерации.
  4. Не доверяйте одному прогону и одному лидерборду: смотрите медиану и разброс.
  5. В многоагентных цепочках помните: ошибка на шаге множится; «98% на агента» ≠ надёжность системы.

Итог

Дешёвый токен ≠ дешёвый агент. Пока вы не меряете путь до закрытой задачи, «оптимизация» модели остаётся маркетингом. Статья — полезный каркас метрик до следующего даунгрейда в проде.