Искусственный интеллект

Стоимость ИИ в проде: где считать токены, а где заявку

Стоимость ИИ в проде: где считать токены, а где заявку

Токен — единица текста, за которую провайдер LLM берёт деньги: входящий запрос и ответ модели складываются в счёт. Дешёвый ответ при дорогом лиде — не победа: экономия на API может обернуться потерей заявки или часами работы менеджера.

Ниже — как на пилоте разделить, где считать токены, а где заявку и качество. Старт внедрения — внедрение ИИ без хаоса; качество ответов — как проверить ответы модели.

Где считать токены, а где — заявку

Счёт от провайдера нейросети видно сразу, а стоимость заявки — нет. Компания месяц радуется, что один ответ стоит копейки, и не замечает, что менеджер переписывает за моделью каждое третье письмо. В таблице — какой сценарий чем мерить: где хватит токенов, а где считать CPL, то есть стоимость одной заявки.

СценарийСчитаемПочему
FAQ на сайте, типовые вопросыТокены + hit-rate кэшаОбъём предсказуем, главное — не переплатить за длинные ответы
Скоринг лида на входеCPL и доля целевыхОшибка модели дороже лишних токенов
Разбор документов и RAGТокены + время эксперта на проверкуГаллюцинация в цифрах бьёт по доверию
Поддержка после продажиCSAT и время до эскалацииДешёвый чат, который не решает — минус к NPS

Лимиты, кэш и эскалация

  • Потолок токенов на один диалог — жёстко в конфиге, не «по ощущениям».
  • Кэш для повторяющихся FAQ с датой обновления и ручным сбросом при смене прайса.
  • Порог эскалации: ключевые слова, неуверенность модели, запрос цены или жалоба.
  • Лог диалогов для выборочной проверки — не только для обучения, но и для аудита расхода.
  • Еженедельный отчёт: токены, число диалогов, целевые лиды, доля эскалаций.

Порог эскалации — это правило, по которому диалог уходит человеку: клиент спросил цену, пожаловался или модель сама не уверена в ответе. Без такого правила чат-бот дёшево отвечает «уточните вопрос» до тех пор, пока клиент не закроет чат и не позвонит конкуренту. Канал эскалации как раз обрывает этот цикл и отдаёт разговор менеджеру.

Зачёркнутое обещание «ИИ окупится сам за месяц» и три измеримых поля пилота: потолок токенов на ответ, стоимость API на сто диалогов, отчёт по расходу раз в неделю.
Обещание окупаемости проверить нельзя. Потолок, стоимость сотни диалогов и недельный отчёт — можно.

Из чего складывается счёт за ИИ

  • Входящий запрос: системная инструкция, история диалога и документы, которые модель перечитывает при каждом обращении.
  • Ответ модели: короткому вопросу с сайта обычно хватает потолка в 500–800 токенов, разбору договора — заметно больше.
  • Повторные попытки: каждый переспрос и каждая перегенерация ответа — это ещё один платный запрос, а не бесплатная правка.
  • Работа людей: часы менеджера на исправление ответов и часы разработчика на переписывание инструкции для модели.

Кто отвечает за экономику пилота

Четыре роли в одном отчёте
Владелец бюджетаСмотрит счёт провайдера и стоимость заявки в одной таблице. Он решает, продлевать пилот, менять сценарий или останавливаться.
РазработчикДержит потолок токенов, кэш и правила эскалации в настройках, а не «на глаз». Он же правит инструкцию, из-за которой модель отвечает вдвое длиннее нужного.
Руководитель продажСчитает, сколько заявок из чата дошло до сделки. Приносит живые примеры ответов, которые менеджеру пришлось переписать вручную.
Маркетолог или аналитикСводит расход на нейросеть с числом целевых заявок за тот же период и сравнивает результат с базой до пилота.

KPI пилота: что зафиксировать до масштаба

До подключения второго канала зафиксируйте KPI: среднее время ответа, доля закрытых обращений без человека, CPL из чата, стоимость API на 100 диалогов. Пилот на 30–60 дней с одним сценарием — не «поставили GPT везде», а измеримый участок воронки.

Порядок первого месяца

  1. Замерить базу до включения нейросети: среднее время ответа, долю обращений, закрытых без человека, и стоимость заявки из этого канала.
  2. Выбрать один сценарий и один канал — например, типовые вопросы на сайте, а не «поставили ИИ везде».
  3. Прописать в настройках потолок токенов на диалог и правила, по которым разговор уходит менеджеру.
  4. Включить кэш для повторяющихся вопросов и назначить, кто сбрасывает его при смене цен и регламентов.
  5. Раз в неделю сводить один отчёт: расход, число диалогов, целевые заявки, доля эскалаций.
  6. На тридцатый день сравнить с базой и только тогда решать, подключать ли второй канал.

ПроверкаЕсли счёт за токены падает, а менеджеры тратят больше времени на исправление ответов — экономия мнимая. Сравнивайте с базой до пилота, а не только с тарифом API.

Частые вопросы

Что дороже: токены или потерянный лид?

Один нецелевой ответ модели стоит копейки. Один упущенный горячий лид — тысячи рублей. Считать нужно обе стороны, не только API.

Когда кэш ответов оправдан?

Когда один и тот же вопрос приходит сотни раз в день: FAQ, статусы заказа, типовые условия. Кэш снижает токены, но требует актуализации при смене цен и регламентов.

Какой лимит токенов ставить на диалог?

Зависит от сценария: короткий FAQ — 500–800 токенов на ответ, разбор документа — выше. Главное — жёсткий потолок и эскалация, а не бесконечный чат.

Как связать стоимость ИИ с CPL?

Суммируете расход API за период, делите на число целевых лидов из канала с ботом. Если CPL растёт при падающем счёте за токены — проблема в качестве, не в тарифе модели.

← Назад к разделу «Искусственный интеллект»