Как измерять качество ответов ИИ, если «вроде нормально» — не метрика
«Вроде нормально» — не метрика. Если по пилоту ИИ нельзя сказать, сколько ответов ушло мимо, сколько звал человека и не откатился ли промпт после правок, вы не управляете качеством. Вы слушаете ощущения.
Статья для собственника и продакта, у которых бот или агент уже отвечает клиентам. Не «с чего начать внедрение» — это в старте пилота без хаоса. Здесь — как за две–четыре недели понять, растёт качество или вы просто привыкли к ошибкам.
Зачем цифры, если менеджеры «в целом довольны»
Менеджеры довольны, пока бот не пообещал скидку или срок визита. Клиент недоволен раньше, но жалоба приходит с задержкой. Без выборки диалогов вы узнаёте о срыве из претензии, а не из отчёта. Масштабировать «вроде норм» — значит размножить срыв.
Цифры не заменяют вкус. Они отвечают на один вопрос: можно ли оставить пилот живым, убить или расширить на другой контур.
Минимум метрик до конца пилота
Хватает четырёх полей. Если поля нет — это ещё не оценка качества, а отзыв в чатике.
| Метрика | Зачем | Как считать |
|---|---|---|
| Выборка диалогов | Иначе смотрите только красивые кейсы | 30–50 случайных за неделю, не «лучшие» |
| Доля верных / с ошибкой | Отделить галлюцинацию от стиля | Человек размечает: ок / мимо / опасно |
| Доля эскалаций | Понять, где бот обязан звать человека | Переводы на сотрудника / все диалоги |
| Регрессия после правок | Новый промпт не ломает вчерашнее | Один и тот же набор кейсов до и после |
ПроверкаПокажите отчёт коллеге из продаж. Если он не понимает, растёт ли качество, таблицу надо упростить.
Регрессия: почему «починили один кейс» ломает десять
Промпт правят под жалобу. Старый набор перестают гонять. Через неделю бот снова «вроде норм», но другие клиенты получают старую ошибку в новой упаковке. Регрессия — это один файл с кейсами, который гоняют после каждой правки. Без него пилот — рулетка.
Что не считать качеством
- Лайки в чате команды и «мне нравится тон».
- Один удачный скрин для презентации инвестору.
- Скорость ответа без проверки смысла.
- Рост числа диалогов без доли ошибок и эскалаций.
Когда пилот можно убить или масштабировать
Убить — если доля опасных ошибок не падает две недели и эскалация не спасает. Масштабировать — если на выборке ошибка ниже порога, который вы сами записали до старта, и регрессия зелёная. Порог без цифры снова превращается в «вроде норм». Как удержать человека в контуре — в где подтверждение обязательно.
Частые вопросы
Сколько диалогов хватит для оценки?
На старте 30–50 случайных за неделю. Меньше — анекдоты. Больше можно, если поток большой и ошибка редкая.
Кто размечает «ок / мимо»?
Человек, который знает продукт: старший поддержки или продакт. Модель сама себе оценку не ставит.
Чем регрессия отличается от A/B?
Регрессия гоняет один и тот же набор после правки промпта. A/B сравнивает два варианта на живом трафике. Сначала регрессия, потом эксперименты.
Нужен ли отдельный KPI на тон ответа?
Только если тон ломает продажу. Сначала ловите опасные факты и ложные обещания — они дороже вежливости.
Что делать, если метрик ещё нет, а бот уже в проде?
Остановить расширение, за неделю снять выборку, зафиксировать порог. Иначе вы масштабируете неизвестность.