Две наивные идеи, которые не работают
Когда говорят «обучить нейросеть на своих данных», обычно представляют одно из двух: либо вставлять все документы прямо в запрос, либо переучивать модель на своих файлах. У обоих есть проблемы. В запрос всё не влезет (у модели ограничен объём контекста), а переобучение весов — дорого, долго и хрупко: добавили новый документ — надо переучивать заново, да и выдумывать модель меньше не станет.
Что такое RAG
RAG (Retrieval-Augmented Generation, «генерация с поиском») — это когда модель перед ответом сначала находит в вашей базе знаний подходящие фрагменты, а потом отвечает, опираясь на них. Грубо: вместо «вспомни» — «загляни в документы и ответь по ним». Знания живут отдельно от модели, поэтому их можно обновлять, просто добавив или заменив документы.
Как это устроено по шагам
| Этап | Что происходит |
|---|---|
| 1. Нарезка | документы делятся на смысловые куски (chunks) нужного размера |
| 2. Векторизация | каждый кусок превращается в «эмбеддинг» — числовой отпечаток смысла |
| 3. Индексация | эмбеддинги складываются в векторную базу для быстрого поиска |
| 4. Поиск | по запросу находятся самые близкие по смыслу куски |
| 5. Переранжирование | из найденного отбираются самые релевантные |
| 6. Генерация | модель отвечает, опираясь на отобранные фрагменты, и ссылается на источник |
Почему RAG, а не дообучение
- •Дешевле и быстрее: не нужно переучивать модель, достаточно проиндексировать документы,
- •Обновляемость: добавили регламент — он сразу доступен, без переобучения,
- •Меньше выдумок: ответ опирается на найденный текст, а не на «память» модели,
- •Прозрачность: можно показать, из какого документа взят ответ.
Дообучение весов остаётся для узких случаев (особый стиль, редкий домен) и почти всегда идёт вместе с RAG, а не вместо него.
Что нужно, чтобы это заработало
RAG разворачивается на AI-сервере: сама языковая модель плюс модель эмбеддингов для поиска. Требования к железу и выбор модели мы разобрали в гайдах как сделать свой AI-сервер и сколько видеопамяти нужно. Для чувствительных данных весь контур ставится локально — документы не покидают периметр.
Частые вопросы
RAG или дообучение — что выбрать?
В большинстве бизнес-задач RAG. Он дешевле, быстрее внедряется и позволяет обновлять знания, просто добавив документы. Дообучение весов нужно редко — когда важен особый стиль или узкий домен, и почти всегда идёт в связке с RAG, а не вместо него.
Нейросеть перестанет выдумывать?
RAG резко снижает выдумки, потому что модель отвечает по найденным фрагментам ваших документов, а не по общим представлениям. Полностью риск не исчезает, поэтому в ответах показывают источники, а на «нет данных» модель настраивают честно говорить об этом.
Наши документы уйдут в облако?
Не обязательно. RAG разворачивается локально на вашем сервере — тогда документы и запросы не покидают периметр. Это стандартная конфигурация для чувствительных данных.