Искусственный интеллект

Корпоративная база знаний с ИИ

Корпоративная база знаний с ИИ

Корпоративная база знаний с ИИ — это ваши регламенты, инструкции и FAQ в одном поиске: сотрудник задаёт вопрос обычными словами и получает фрагмент из актуального документа, а не десять ссылок в общей папке.

Разбираем порядок работ на примере сервисной компании, где больше двухсот инструкций, а вопросы сотрудников каждый день оседают в кадровой службе и в поддержке. Ниже — что собрать до индексации, как устроен поиск по смыслу, как закрыть документы правами доступа и какие цифры показать руководству после пилота. Смежное: AI-интеграции и разбор архитектуры в статье про поиск по своим документам.

Сколько стоит вопрос, на который никто не находит ответ

Инструкция лежит в общей папке, но сотрудник её не находит: имя файла ничего не говорит, поиск по названию выдаёт три версии одного документа, и человек идёт спрашивать коллегу. На один такой вопрос уходит 15–20 минут, и через месяц он повторяется у следующего новичка.

Инвентаризация документов перед индексом

  • Список источников: Confluence, SharePoint, PDF, Notion — с владельцем.
  • Удалить или пометить устаревшие версии — иначе бот цитирует прошлогодний регламент.
  • Приоритет: документы, по которым чаще всего спрашивают HR и линию поддержки.
  • Формат: текстовый слой в PDF, не скан без OCR.

Семантический поиск и chunking

Документы режут на фрагменты (chunking) с перекрытием, каждый фрагмент превращают в embedding — числовой вектор смысла. Запрос сотрудника ищет ближайшие векторы (vector search), retrieval отдаёт top-k фрагментов в модель или в выдачу поиска.

Обычными словами это значит вот что: система ищет не точное слово из заголовка, а близкий по смыслу кусок текста. Такой способ отвечать называют RAG — нейросеть не выдумывает ответ «из головы», а сначала находит фрагменты в ваших документах и пересказывает их, показывая, откуда взяла.

Чат по внутренним регламентам: вопрос сотрудника «Как оформить отпуск?» и ответ со сроком подачи заявления, названием регламента и датой актуальности.
Ценность ответа — в названии документа и дате рядом с ним: их видно сразу, без похода в папку.

Из чего собирается рабочая база знаний

Четыре слоя базы знаний
Актуальные документыУ каждого регламента есть владелец и дата пересмотра. Старые версии убирают из индекса, иначе бот процитирует порядок, который отменили в прошлом году.
Поиск по смыслуСотрудник спрашивает обычными словами, а система находит нужный фрагмент, даже если этих слов нет в заголовке документа.
Ответ с источникомЧат собирает ответ из найденных фрагментов и показывает, из какого документа он взят и на какую дату документ актуален.
Права и журнал запросовИндекс режут по отделам, вход идёт через корпоративный логин, запросы сохраняются в журнале для службы безопасности.

Отдельная история — вход и права. Единый корпоративный вход (SSO, single sign-on) — это когда сотрудник открывает базу тем же логином, что и рабочую почту, а не заводит ещё один пароль. Тот же логин говорит системе, из какого человек отдела, — по этому признаку и режут индекс.

Права доступа и SSO

  1. Вход через корпоративный SSO — не отдельный пароль на базу.
  2. Индекс с меткой отдела: продажи не видят кадровые регламенты.
  3. Аудит запросов: кто спрашивал что — для compliance.
  4. Обновление индекса по webhook при смене документа в wiki.

Пилот на две недели: KPI для руководства

МетрикаДоЦель пилота
Минуты на поиск ответа15–20< 3
Повторные вопросы в HRбаза−30%
Доля ответов с источником> 90%
Эскалации «не нашёл»< 10%

ФактНе переносите всю wiki в первый релиз: один отдел, один тип документов, измеримый результат — потом масштаб.

Частые вопросы

Чем база знаний с ИИ отличается от обычной wiki?

Семантический поиск находит ответ по смыслу, а не только по точному слову в заголовке. Чат-бот собирает ответ из фрагментов с цитатой источника — если настроен RAG.

Как не допустить утечки данных?

SSO и права по отделам: индекс режется по ролям. Логи без экспорта в публичные модели без DPA. Пилот на одном контуре до масштабирования.

С чего начать, если 200+ PDF?

Инвентаризация: актуальные регламенты, владельцы, частота обновлений. Пилот на 30–50 документов одного отдела. Chunking и embedding — потом чат.

Как показать ROI руководству?

До/после: минуты на поиск ответа, число повторных вопросов в HR/IT, доля обращений первой линии. Пилот 2 недели даёт цифры, не презентацию.

← Назад к разделу «Искусственный интеллект»