Перейти к содержимому
Назад к блогу
Обучение

Как обучить ИИ на своих документах: RAG и база знаний

Как на самом деле обучить ИИ на своих документах: чем отличаются загрузка в контекст, RAG, дообучение и база знаний, и что выбрать в 2026 году.

AgentHere Team
AgentHere TeamАвтор
Обновлено: 7 августа 2026 г.11 мин чтения
Содержание

Хотите, чтобы нейросеть отвечала по вашим регламентам, договорам и прайс-листам, а не выдумывала общие фразы? Тогда для начала разберёмся, как обучить ИИ на своих документах на самом деле. Строго говоря, в этой фразе слово «обучение» — бытовое: имеют в виду не тренировку модели, а три разных способа дать языковой модели доступ к вашим данным. Первый — загрузить файл прямо в окно чата. Второй — построить систему RAG (Retrieval-Augmented Generation), то есть поиск по базе знаний с генерацией ответа. Третий — дообучить модель (fine-tuning). Главная ошибка — думать, что если загрузить PDF в чат, нейросеть «запомнит» его навсегда. На самом деле файл живёт только в текущем диалоге и забывается, как только вы закрываете вкладку. Термин RAG ввели Патрик Льюис и соавторы в работе 2020 года: модель перед ответом ищет нужные фрагменты в вашей базе знаний и опирается именно на них. В этом руководстве — все четыре способа, их реальные ограничения и цена, и какой выбрать именно вам в августе 2026 года.

Разве нельзя просто загрузить файл в чат?

Самый частый сценарий — пользователь прикрепляет договор, прайс-лист или регламент к сообщению и спрашивает: «Что тут написано про возврат?». Модель читает содержимое файла прямо в текущем окне контекста и отвечает. Это удобно, быстро и не требует никакой инфраструктуры. Но у этого способа есть три жёстких ограничения, о которых молчат восторженные обзоры.

Во-первых, эффект «золотой рыбки». Как только вы начали новый диалог, загруженный файл исчезает. Модель не выучила его — она просто держала текст перед «глазами» один раз. Чтобы снова задать вопрос по тому же документу, его нужно прикреплять заново. Никакого накопления знаний не происходит: сегодня и через месяц модель будет одинаково «не в курсе», если вы не приложите файл снова.

Во-вторых, ограничение размера контекстного окна. У современных моделей окно большое — сотни тысяч и даже миллионы токенов, — но оно не бесконечное. Если вы загрузите 200 страниц договоров и 50 отчётов, модель либо не сможет это проглотить, либо начнёт «терять» фрагменты в середине — явление, известное как lost in the middle: крайние части текста модель обрабатывает внимательнее, чем центральные. На больших объёмах точность ответов падает, даже если формально всё влезло в лимит.

В-третьих, стоимость и скорость. Каждый токен из загруженного файла оплачивается при каждом запросе заново — вы платите за пересылку одного и того же PDF десятки раз. Чем больше файл, тем медленнее ответ и тем дороже каждый следующий вопрос по нему. Конкретный пример: вы загрузили 80-страничный регламент и задаёте по нему вопросы в течение дня. Каждый из, скажем, тридцати вопросов оплачивается так, будто регламент отправляется заново — потому что для модели это каждый раз новый запрос, который нужно полностью «перечитать». В чате это незаметно, но в бюджете — ощутимо.

⚠️ Главное правило. Загрузка файла в чат — это «прочитать вслух один раз», а не «выучить наизусть». Если вам нужна постоянная база знаний, на которую агент опирается каждый раз, вам нужен RAG или отдельный ассистент с базой знаний — но не надежда, что чат что-то запомнил.

В обзоре ИИ для Excel, таблиц и PDF мы уже показывали, что загрузка документа хорошо работает для разовых задач: «вытащи таблицу», «перепиши абзац», «найди пункт 4.2». Для повторяющихся вопросов по растущему архиву документов этого недостаточно — там нужен поиск по базе.

Что такое RAG и как он работает на практике?

RAG (Retrieval-Augmented Generation) — это схема, в которой языковая модель не хранит ваши данные внутри себя, а перед ответом достаёт нужные фрагменты из отдельной базы знаний и опирается на них. Термин ввела группа исследователей во главе с Патриком Льюисом в статье «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks» (NeurIPS 2020). Авторы показали, что модели с таким внешним поиском дают более конкретные и фактические ответы, чем модели, опирающиеся только на свои веса (arXiv:2005.11401).

Конвейер RAG состоит из пяти шагов:

  1. Чанкинг (chunking). Документы режутся на небольшие фрагменты — «чанки» — обычно по несколько сотен токенов с перекрытием, чтобы не разрезать предложение или пункт договора пополам. Размер чанка влияет на точность: слишком мелкий — теряется контекст, слишком крупный — в окно попадает много шума.
  2. Эмбеддинги (embeddings). Каждый чанк превращается в вектор — числовой «отпечаток» смысла. Близкие по смыслу фрагменты получают близкие векторы. Эмбеддинг-модели специально обучены так, чтобы семантически похожие тексты оказывались рядом в многомерном пространстве: вопрос «какие сроки поставки?» векторно ляжет рядом с чанком «поставка осуществляется в течение 14 дней», хотя общих слов почти нет.
  3. Векторная база (vector store). Векторы вместе с текстом чанка складируются в специализированное хранилище: pgvector (расширение PostgreSQL), Qdrant, Milvus, Weaviate, Chroma. По состоянию на август 2026 года это зрелая категория с открытыми и облачными решениями (Qdrant, Хабр: глубокий разбор RAG).
  4. Поиск (retrieval). Когда пользователь задаёт вопрос, его тоже превращают в вектор и ищут в базе ближайшие по смыслу чанки. В продакшене почти всегда используют гибридный поиск — сочетание векторного (по смыслу) и классического текстового BM25 (по точным словам и фразам), потому что в чистом виде каждый из них проигрывает на разных типах запросов.
  5. Генерация (generation). Найденные чанки подставляются в промпт модели вместе с вопросом, и модель формулирует ответ, опираясь именно на них — и, что важно, может сослаться на источник.

💡 Про чанки — критически важно. Именно на этапе чанкинга RAG ломается чаще всего. Если пункт договора разрезан посередине, эмбеддинг этого осколка теряет смысл, и поиск его не найдёт. Anthropic в сентябре 2024 года предложила метод Contextual Retrieval: к каждому чанку модель добавляет короткое пояснение, откуда он взят. В сочетании с гибридным поиском это снизило долю потерянных релевантных фрагментов с 5,7% до 2,9% (Anthropic Engineering).

Инфографика: схема RAG — пять шагов от документа до ответа с цитатой, август 2026

Чем RAG отличается от дообучения (fine-tuning)?

Это вторая по частоте путаница. Дообучение — это настоящая тренировка модели на ваших примерах: веса нейросети физически меняются на серверах разработчика. RAG — это поиск плюс генерация, веса не трогаются вообще. Разница принципиальная, и OpenAI прямо указывает в своей документации: дообучение не предназначено для того, чтобы научить модель новым фактам (OpenAI: fine-tuning guide). Его сила — в стиле, формате и поведении, а не в знаниях.

Представьте разницу так. Дообучение — это как отправить сотрудника на курсы: он вернётся с новыми манерами и речевыми оборотами, но конкретный прайс-лист от августа ему всё равно нужно будет держать перед глазами. RAG — это положить тот самый прайс-лист сотруднику на стол: знания всегда свежие и под рукой, но манеры у него не изменились. Поэтому в реальных проектах их часто комбинируют: RAG отвечает за факты, лёгкое дообучение — за фирменный тон и формат.

КритерийRAG / база знанийДообучение (fine-tuning)
Что меняетсяИсточник данных моделиВеса самой модели
Для чего подходитТочные факты, актуальные документы, ответы по регламентамТон, формат, стиль ответов, жаргон компании
Добавление новых данныхПоложить файл в базу — минутное делоНужен новый цикл тренировки (часы/дни, GPU)
Свежесть знанийОбновляется мгновенноЗаморожено на момент тренировки
Цитируемость источниковДа — можно показать чанк-источникНет — знания «вшиты», неоткуда процитировать
Исправление ошибкиУдалить или поправить документПереобучить заново
Стоимость входаСредняя (эмбеддинги + хранение)Высокая (разметка + вычисления)

Практический вывод простой: если ваша боль — «модель не знает наши документы» или «данные постоянно меняются», вам нужен RAG. Если боль — «модель отвечает не в нашем стиле» или «использует неправильный формат», тогда fine-tuning. Очень часто комбинация обоих даёт лучший результат: RAG поставляет факты, а дообучение настраивает тон, в котором агент эти факты подаёт.

Какие способы «обучить ИИ на своих документах» существуют?

Сведём всё в одну картину. На практике у вас четыре архитектурных варианта, и они не взаимоисключающи — их можно комбинировать:

СпособУсилияСвежесть данныхТочность по фактамДоступ из РФ (август 2026)
Загрузка в контекстминимальныетолько текущий чатвысокая в рамках окнаограниченный
RAG / база знанийсредниемгновенное обновлениевысокая, с цитатамизависит от стека
Дообучениевысокиетребует переобученияне подходит для фактовредко, дорого
Кастомный ассистент (GPT-стиль с залитыми файлами)низкиеобновление файлов вручнуюсредняяограниченный

Как выбрать под типичную задачу:

  1. Разово разобрать один документ (договор, отчёт, прайс) — достаточно загрузки в контекст. Дёшево, быстро, без настройки.
  2. Регулярные вопросы по растущему архиву (база регламентов, каталог из тысяч позиций, переписка с клиентами) — нужен RAG. Один раз настраиваете конвейер, дальше просто пополняете базу.
  3. Закрепить фирменный стиль и формат ответов (агент всегда отвечает в духе бренда, использует нужные термины) — лёгкое дообучение или хорошо написанный системный промпт.
  4. Готовый помощник «под ключ» без программирования — соберите агента на платформе вроде AgentHere, загрузите в него файлы как базу знаний и опишите правила работы. Это самый быстрый путь для бизнеса.

Подробно о том, как устроены ИИ-агенты и чем они отличаются от обычного чат-бота, мы разбирали в статье «Что такое ИИ-агенты». А о стандарте, через который агент подключается к вашим данным и инструментам, — в обзоре MCP (Model Context Protocol). Эти два материала стоит прочитать рядом с этой статьёй: они объясняют «обвязку» вокруг базы знаний — кто именно по ней ищет и как подключается.

Почему RAG снижает галлюцинации и как с ним работают цитаты?

Галлюцинации — это когда модель уверенно выдумывает факт, которого нет в источнике. Корень проблемы в том, что модель генерирует правдоподобный текст, а не «ищет истину». RAG сужает пространство выдумки: модель получает указание опираться только на поданные ей фрагменты и прямо ссылаться на них.

Это работает на трёх уровнях. Во-первых, факты оказываются в окне контекста — модели не нужно «вспоминать» их из обучающей выборки, где они могли исказиться или устареть. Во-вторых, можно потребовать цитату: хороший RAG-промпт заставляет модель указывать, из какого документа и абзаца взят ответ. В-третьих, ошибку можно отследить: если агент соврал, вы видите, какой чанк он использовал, и правите именно источник, а не «переучиваете» модель заново.

Важный нюанс: RAG не исключает галлюцинации полностью. Если релевантного фрагмента в базе нет (плохой поиск, документ не загружен), модель может либо честно сказать «не знаю», либо попытаться ответить по общим знаниям — и тут соврать. Поэтому качество retrieval (поиска) критичнее, чем выбор самой модели. В продакшене используют гибридный поиск, переранжирование результатов (reranking) и явно прописанное правило: «если в найденных фрагментах нет ответа — признайся, что не знаешь, и не додумывай». Это правило в системном промпте отсекает львиную долю выдумок.

Полезно и периодически проверять систему: взять набор типичных вопросов с уже известными правильными ответами и прогнать их через RAG-пайплайн. Если на десяти проверочных вопросах агент девять раз сослался на верный фрагмент — поиск работает. Если трижды не нашёл релевантный чанк, хотя он в базе есть — значит, проблема в чанках или эмбеддингах, а не в модели, и чинить надо именно конвейер.

💡 Цитаты = доверие. В задачах, где цена ошибки высока (юрист, финансы, медицина), ответ без ссылки на источник практически бесполезен. Хороший пример — ИИ-юрист 2026: ответы по нормативным актам без цитаты конкретного пункта не имеют силы. RAG — единственная из четырёх схем, которая позволяет встроить цитату в ответ по самой своей конструкции.

Как дать агенту свою базу знаний в AgentHere?

На платформе AgentHere самый простой путь не требует ни RAG-конвейера, ни дообучения: вы создаёте агента и прикрепляете документы прямо в чат — агент читает их как свою рабочую базу знаний на время сессии. Под капотом работает инструмент чтения документов: при загрузке PDF, Word, Excel, PowerPoint, CSV или текстового файла система локально извлекает из него текст (для PDF используется библиотека pdfplumber, без отправки файла на сторонние серверы), кэширует результат и передаёт модели — без отдельного вызова платной модели для самого извлечения. Модель работает именно с реальным текстом документа, а не с догадками о нём.

Когда это удобно:

  • собрать ассистента, который отвечает по вашим регламентам, прайс-листам и FAQ;
  • дать агенту техническую документацию продукта, чтобы он помогал клиентам точно по мануалу;
  • загрузить пакет договоров и быстро находить нужные пункты;
  • сделать отраслевого помощника (юриста, аналитика, HR), который опирается на ваши внутренние документы.

Пошагово:

  1. Соберите агента в галерее AgentHere или начните с готового шаблона — программировать не нужно.
  2. Опишите правила: как агент должен отвечать, на каком языке, в каком формате, обязательно ли ссылаться на документ.
  3. Прикрепите документы в чат — агент прочитает их содержимое через инструмент чтения и будет опираться на него в ответах.
  4. Обновляйте базу: вместо переобучения просто замените файл — при следующем запросе агент возьмёт свежую версию.

Для задач, где документов действительно много (тысячи) и нужна постоянная индексация с векторным поиском по всей корпоративной базе, полноценный RAG на собственной инфраструктуре (pgvector плюс Qdrant или Chroma) остаётся решением для разработчиков. Это уже отдельный инженерный проект: выбор эмбеддинг-модели, настройка чанкинга, гибридный поиск, мониторинг качества ответов. Но и он строится на тех же пяти шагах, которые мы разобрали выше. Но для большинства задач бизнеса и частных пользователей чтения документов агентом в чате хватает полностью — это и есть та «база знаний», ради которой вы, скорее всего, и читаете эту статью.

Готовы попробовать? Соберите своего агента за несколько минут или зарегистрируйтесь и прикрепите к чату первый документ — модель прочитает его и ответит по делу, а не по памяти.

Источники

#обучить ИИ на своих документах #RAG #база знаний #эмбеддинги #дообучение

Похожие статьи

Как обучить ИИ на своих документах: RAG и база знаний | AgentHere