Искусственный интеллект

Как проверить RAG перед продом: чеклист качества ответов

Как проверить RAG перед продом: чеклист качества ответов

RAG — это когда модель отвечает не «из головы», а ищет фрагменты в ваших документах и собирает ответ из них. Это рабочий чеклист перед продом: что проверить в поиске по базе и в качестве ответов, прежде чем открыть доступ сотрудникам или клиентам.

Идите группами сверху вниз. Пункт закрыт только по «готово, если». Контекст внедрения: старт ИИ в бизнесе; архитектура агентов: ИИ-агенты 2026.

Индекс и данные

  • Документы разбиты на фрагменты с перекрытием — chunking не режет таблицы и списки посередине.
  • Устаревшие версии регламентов помечены или удалены из индекса.
  • Метаданные: отдел, дата, тип документа — фильтры работают в тестах.
  • Готово, если по 10 контрольным вопросам retrieval находит актуальный фрагмент в top-3.

Качество retrieval

  • Набор из 30+ вопросов с эталонным источником — таблица вопрос / ожидаемый doc / фактический top-1.
  • Синонимы и разговорные формулировки — не только дословные заголовки из PDF.
  • Негативные кейсы: вопрос вне базы — бот не подставляет случайный фрагмент.
  • Готово, если hit@3 ≥ 85% на контрольном наборе или согласованный порог с клиентом.

Генерация ответа и галлюцинации

  • Ответ цитирует источник — ссылка или номер документа в интерфейсе.
  • Цифры и сроки в ответе совпадают с фрагментом — выборочная сверка 20 ответов.
  • Промпт запрещает выдумывать то, чего нет в контексте.
  • Готово, если при ручной проверке 10% выборки нет критичных фактических ошибок.

Эскалация и безопасность

  • Низкая уверенность → «не нашёл в базе» или тикет человеку, не догадка.
  • Права доступа: пользователь видит только документы своего отдела.
  • Логи запросов без утечки ПДн в сторонние системы без договора.
  • Готово, если сценарий «вопрос про зарплату другого отдела» не отдаёт чужой регламент.
Диалог RAG с цитатой источника

ФактРазбейте чеклист на два захода: индекс + retrieval, затем генерация + эскалация. Не отмечайте прод, пока красные пункты в первых двух группах.

Частые вопросы

Что проверять в RAG в первую очередь?

Retrieval: находит ли поиск нужный фрагмент по типовому вопросу. Потом генерацию: ответ опирается на найденное, а не выдумывает. Потом эскалацию к человеку, если уверенность низкая.

Сколько тестовых вопросов достаточно перед продом?

Минимум 30–50: по категориям документов, по edge-кейсам (устаревшие регламенты, синонимы, опечатки). Плюс 10 вопросов, на которые бот должен сказать «не знаю».

Как измерить качество retrieval?

Для каждого вопроса фиксируют эталонный фрагмент и смотрят, попал ли он в top-k. Метрика hit@k и доля ответов с правильным источником в цитате.

Можно ли запускать RAG без HITL?

Для внутренних регламентов — с выборочной проверкой. Для клиентских обещаний, цен и сроков — финальная проверка человеком или жёсткий запрет на ответ без источника.

← Назад к разделу «Искусственный интеллект»