Внедрение ИИ в бизнес: RAG, ассистенты, ERP

LLM-шлюз, бюджеты и оценка качества

Команды сжигают счёт LLM и не могут сказать, помог ли вчерашний промпт.

Обсудить это направлениеФорма контакта

Кратко опишите цель, ограничения стека и сроки — отвечу в Telegram.

Команды сжигают счёт LLM и не могут сказать, помог ли вчерашний промпт. Этот трек — шлюз: маршрутизация моделей, потолки токенов и денег, логи промптов (с редакцией) и контур оценки. Это не безопасность данных (роли, on-prem, шифрование). Это не RAG. Это плоскость управления под ассистентами, RAG и агентами.

Делаю небольшой сервис, который вызывают приложения вместо россыпи SDK: ключи в одном хранилище, квоты по командам, запасной маршрут (провайдер лёг, лимит), трассы, которые можно связать с id тикета. Качество — на замороженном наборе: эталонные вопросы, ожидаемые цитаты, исходы тулов, а не «основатель кликнул чат один раз». Тексты: LLM-шлюз и FinOps, контур оценки ИИ, тестирование качества LLM.

Первый срез: обернуть один прод-путь (внутренний FAQ или черновик ответа поддержке) бюджетами и еженедельным прогоном eval. Сравнение десяти вендоров подождёт цифр. On-prem модели входят в тот же интерфейс, если политика требует.

Стек: шлюз на TypeScript/Node.js, Postgres для учёта, по желанию Redis для лимитов. Eval на Python, если остальной ML уже там. Портфолио: cursor-telegram-integration, thinklens-bot — без учёта стоимости они остаются демо.

Вне скоупа: закупка GPU «для независимости» и обещание минус 40% без недели базовых логов.

Срок: рабочий шлюз плюс первый eval часто за 3–7 недель. Если уже есть разрозненные вызовы OpenAI в трёх репозиториях, первый milestone — свести их в один клиент и неделю мерить факт, а не «оптимизировать вслепую».

Что входит

  • Единая точка входа к LLM, ключи, квоты, запасные маршруты
  • Логи с редакцией и сроком хранения, который вы утвердили
  • Eval-набор, расписание, короткий отчёт для руководителя
  • Runbook: ротация ключей, повышение потолка команде

Частые вопросы

Нажмите на вопрос, чтобы раскрыть ответ.

Это привязка к одному вендору?

Нет. Смысл — менять и маршрутизировать без переписывания каждого бота. Первый вендор — тот, за кого уже платите.

Логируете полные промпты клиентов?

Только с письменной политикой хранения и редакцией. По умолчанию — id, хеши, усечённые выборки, не поисковый дамп ПДн.

Eval — это тесты RAG?

RAG-eval — поиск плюс ответ. Шлюз считает стоимость, задержку и регрессии всех вызовов. Фикстуры пересекаются, если продукт — grounded-ассистент.

Обсудить это направлениеФорма контакта

Кратко опишите цель, ограничения стека и сроки — отвечу в Telegram.

Полное описание услуги