Содержание
Введение
После выбора архитектуры, модели и инфраструктуры нужно решить, какие данные получит корпоративный ИИ. На практике качество их подготовки чаще определяет качество ответа, чем новая версия модели. Модель не исправит дубли, устаревшие регламенты и хаос в документах.
Почему это важно
RAG работает настолько хорошо, насколько надёжны его источники. Если база знаний содержит противоречия или неактуальные версии, система воспроизведёт эти проблемы в ответах. Поэтому подготовка данных — отдельный инженерный процесс с правилами, ответственными и проверяемым результатом.
Основное объяснение
Конвейер подготовки включает инвентаризацию источников, очистку и нормализацию документов, удаление дублей, выделение метаданных, разбиение на смысловые фрагменты, создание эмбеддингов, индексацию и регулярное обновление.
flowchart LR
sources[Источники данных] --> cleaning[Очистка]
cleaning --> normalize[Нормализация]
normalize --> chunks[Смысловые фрагменты]
chunks --> embeddings[Эмбеддинги]
embeddings --> index[Векторный индекс]
index --> rag[RAG]
Размер фрагмента не бывает универсальным. Слишком крупные ухудшают точность поиска, слишком мелкие лишают модель контекста. Правило разбиения выбирают для структуры документов и пользовательских сценариев, а затем проверяют на реальных запросах.
Метаданные не менее важны, чем текст: автор, дата утверждения, версия, подразделение, категория, срок действия и уровень конфиденциальности помогают искать точнее и применять нужные ограничения.
Безопасность
| Требование | Практическое значение |
|---|---|
| Классификация документов | Закрытые материалы не индексируются без разрешения |
| Проверка актуальности | В поиск попадают действующие версии |
| Владельцы источников | Есть ответственные за качество и изменения |
| Журналирование обновлений | Можно проследить происхождение данных |
| Фильтрация по ролям | Будущая выдача учитывает права пользователя |
Права доступа должны быть частью данных и конвейера, а не проверкой, которую пытаются добавить после индексации.
Корпоративный пример
Промышленный холдинг получает документы из системы управления ресурсами предприятия, системы электронного документооборота, файловых архивов и внутреннего портала. Единый конвейер очищает их от технического мусора, добавляет метаданные, формирует фрагменты и проверяет качество. База знаний становится единообразной, хотя исходные системы различаются.
Пример из промышленной безопасности
Для экспертов подготавливают нормы, внутренние методики, архив заключений и результаты обследований. Устаревшие нормативные редакции хранятся для исторического анализа, но исключаются из обычного поиска. Это уменьшает риск сослаться на недействующее требование при подготовке заключения.
ИИ формирует ответ на основе разрешённых материалов, а специалист проверяет основания вывода и несёт ответственность за итоговое решение.
Типичные ошибки
- Индексировать документы без очистки.
- Не учитывать версии и сроки действия.
- Применять одинаковое разбиение ко всем типам данных.
- Игнорировать метаданные и владельцев источников.
- Не обновлять индекс регулярно.
Практические выводы
Перед запуском подготовьте каталог источников, правила очистки, модель метаданных, стратегию разбиения, регламент обновления и процедуру контроля качества. Это превращает архивы в управляемую базу знаний, а не в ещё одно хранилище файлов.
Ключевые тезисы
- Качество данных важнее количества документов.
- Подготовка данных требует отдельного процесса и ответственности.
- Метаданные повышают точность поиска и поддерживают безопасность.
- Версионирование обязательно в корпоративной среде.
- База знаний должна обновляться непрерывно.

