Искусственный интеллект

Как измерять качество ответов ИИ, если «вроде нормально» — не метрика

Как измерять качество ответов ИИ, если «вроде нормально» — не метрика

«Вроде нормально» — не метрика. Если по пилоту ИИ нельзя сказать, сколько ответов ушло мимо, сколько звал человека и не откатился ли промпт после правок, вы не управляете качеством. Вы слушаете ощущения.

Статья для собственника и продакта, у которых бот или агент уже отвечает клиентам. Не «с чего начать внедрение» — это в старте пилота без хаоса. Здесь — как за две–четыре недели понять, растёт качество или вы просто привыкли к ошибкам.

Зачем цифры, если менеджеры «в целом довольны»

Менеджеры довольны, пока бот не пообещал скидку или срок визита. Клиент недоволен раньше, но жалоба приходит с задержкой. Без выборки диалогов вы узнаёте о срыве из претензии, а не из отчёта. Масштабировать «вроде норм» — значит размножить срыв.

Цифры не заменяют вкус. Они отвечают на один вопрос: можно ли оставить пилот живым, убить или расширить на другой контур.

Минимум метрик до конца пилота

Хватает четырёх полей. Если поля нет — это ещё не оценка качества, а отзыв в чатике.

МетрикаЗачемКак считать
Выборка диалоговИначе смотрите только красивые кейсы30–50 случайных за неделю, не «лучшие»
Доля верных / с ошибкойОтделить галлюцинацию от стиляЧеловек размечает: ок / мимо / опасно
Доля эскалацийПонять, где бот обязан звать человекаПереводы на сотрудника / все диалоги
Регрессия после правокНовый промпт не ломает вчерашнееОдин и тот же набор кейсов до и после

ПроверкаПокажите отчёт коллеге из продаж. Если он не понимает, растёт ли качество, таблицу надо упростить.

Зачёркнуто «вроде нормально». Рядом три поля: выборка, доля ошибок, эскалации.
Качество — не настроение, а три числа за неделю.

Регрессия: почему «починили один кейс» ломает десять

Промпт правят под жалобу. Старый набор перестают гонять. Через неделю бот снова «вроде норм», но другие клиенты получают старую ошибку в новой упаковке. Регрессия — это один файл с кейсами, который гоняют после каждой правки. Без него пилот — рулетка.

Что не считать качеством

  • Лайки в чате команды и «мне нравится тон».
  • Один удачный скрин для презентации инвестору.
  • Скорость ответа без проверки смысла.
  • Рост числа диалогов без доли ошибок и эскалаций.

Когда пилот можно убить или масштабировать

Убить — если доля опасных ошибок не падает две недели и эскалация не спасает. Масштабировать — если на выборке ошибка ниже порога, который вы сами записали до старта, и регрессия зелёная. Порог без цифры снова превращается в «вроде норм». Как удержать человека в контуре — в где подтверждение обязательно.

Частые вопросы

Сколько диалогов хватит для оценки?

На старте 30–50 случайных за неделю. Меньше — анекдоты. Больше можно, если поток большой и ошибка редкая.

Кто размечает «ок / мимо»?

Человек, который знает продукт: старший поддержки или продакт. Модель сама себе оценку не ставит.

Чем регрессия отличается от A/B?

Регрессия гоняет один и тот же набор после правки промпта. A/B сравнивает два варианта на живом трафике. Сначала регрессия, потом эксперименты.

Нужен ли отдельный KPI на тон ответа?

Только если тон ломает продажу. Сначала ловите опасные факты и ложные обещания — они дороже вежливости.

Что делать, если метрик ещё нет, а бот уже в проде?

Остановить расширение, за неделю снять выборку, зафиксировать порог. Иначе вы масштабируете неизвестность.

← Назад к разделу «Искусственный интеллект»