RAG — способ научить нейросеть отвечать по документам компании без дообучения модели. Как устроена векторная база знаний, чем RAG отличается от файн-тюнинга и где спрятана настоящая работа.
Самый частый вопрос на корпоративных обучениях — как научить нейросеть работать с нашими внутренними документами. Договоры, регламенты, база знаний техподдержки. Ответ почти всегда один — вам нужен RAG. И его важно не путать с дообучением модели.
Что такое RAG
RAG, Retrieval Augmented Generation, — подход, при котором модель сначала обращается к подготовленной базе ваших документов, находит релевантные фрагменты и только на их основе формирует ответ. Моя любимая аналогия — библиотекарь с хорошим каталогом. Он не читал все книги, но точно знает, где что лежит.
Технически это устроено так. Документы нарезаются на смысловые фрагменты — чанки. Каждый чанк превращается в эмбеддинг — числовой вектор, отражающий смысл фрагмента. Векторы складываются в векторную базу данных. Ваш вопрос тоже векторизуется, система находит ближайшие по смыслу фрагменты и добавляет в промпт только их. Модель отвечает, опираясь на конкретные куски ваших документов, поэтому меньше выдумывает и не перегружает контекст.
[Место под скриншот — слайд «13.0.4 RAG — как работает», презентация /edu/speaker/walkthrough]
Чем RAG отличается от дообучения
При RAG модель не меняется. Меняется только то, что ей подают на вход. Дообучение, файн-тюнинг, устроено иначе — базовую модель дополнительно обучают на ваших данных, и она усваивает терминологию, стиль и специфику предметной области. Это дорого и долго, серьёзное внедрение занимает от трёх до девяти месяцев. Так работают крупные игроки. Сбер нанимает преподавателей и врачей для дообучения ГигаЧата, Яндекс держит сеть разметчиков по всей стране, Норникель дообучил открытую модель на металлургических данных и получил МеталГПТ. Для большинства компаний правильная точка входа — RAG.
[Место под скриншот — слайд «3.3a Fine-tuning vs RAG — когда что нужно», презентация /edu/speaker/walkthrough]
Как собрать базу знаний на практике
Схема, которая работает у малого бизнеса. Собираете все документы — КП, договоры, регламенты, FAQ. Нарезаете на смысловые блоки. Векторизуете любой embed-моделью и складываете в векторную базу, простейший вариант — Супабейз, открытая база данных с векторным расширением. Дальше связка из поиска ближайших чанков и ответа модели собирается в n8n или на готовой корпоративной платформе вроде ГигаЧат Энтерпрайз.
Есть и случай, когда RAG не нужен. Если вся база знаний — это десяток документов, они помещаются в контекст напрямую. Просто прикладывайте файлы к запросу. ДипСик принимает до 25 файлов за заход, Квен до 5, и для разового анализа договоров этого достаточно. RAG становится нужен, когда документов сотни и тысячи, а вопросы к ним задаются регулярно.
Промежуточный шаг перед полноценным RAG — системный промпт для повторяемых задач. После удачного разового анализа попросите модель «напиши системный промпт для юриста-агента, который будет анализировать наши договоры, пропиши формат ответа и логику проверки». Сохраняете в файл и в следующий раз не объясняете всё с нуля.
Где спрятана настоящая работа
Технически собрать RAG несложно. Настоящая работа — превратить тысячи договоров в качественную структурированную базу. Механическая нарезка по числу символов ломает смысл. Договор на 400 страниц разрежется так, что ключевые условия оборвутся на границах фрагментов. Нарезку должен проверить человек, который понимает документы. По трудозатратам эта часть сопоставима с покупкой сервера, и именно она определяет качество ответов будущей системы.
Что это даёт
Живой пример из моей практики. В базу пишется «внеси встречу в Станкине 5 июня», а позже запрашивается «выгрузи все мероприятия, связанные с вузами» — и модель отдаёт готовую таблицу, без открытия самой базы и её интерфейсов. Тот же принцип масштабируется на базу знаний техподдержки, юридический архив, внутренние регламенты. Вопрос на естественном языке, ответ по вашим документам, с точными цитатами.
И последнее, о чём забывают. База знаний живёт. Регламенты обновляются, договоры перезаключаются, и устаревший чанк в выдаче хуже отсутствующего — модель процитирует его с полной уверенностью. Назначьте владельца базы и процедуру актуализации сразу, на старте проекта.
Спроектировать RAG под задачи вашей команды можно на корпоративном обучении по ИИ.