Перейти к содержимому

НейросетиРазбор

Как заставить нейросеть отвечать по вашим документам и при чём тут RAG

RAG учит нейросеть отвечать по вашим документам, а не по памяти. Разбираем, как это устроено, где помогает и почему проблему ошибок оно решает только наполовину.

Иллюстрация к материалу «Как заставить нейросеть отвечать по вашим документам и при чём тут RAG» — рубрика Нейросети
Содержание6 разделов

Коротко

  • RAG расшифровывается как Retrieval-Augmented Generation, по-русски «генерация с поиском».
  • Сначала система находит нужные куски ваших документов, потом отдаёт их модели вместе с вопросом.
  • Так модель отвечает по свежим и внутренним данным, которых не было при обучении.
  • Качество зависит от поиска: не нашёлся нужный кусок, и ответ будет неверным.

Языковая модель знает только то, что было в её обучающих данных. Про ваш регламент отпусков, прайс прошлого месяца или договор с поставщиком она не знает ничего. Документы можно каждый раз вставлять в чат, но в компании их сотни и тысячи. Для этого и придумали RAG.

Как работает RAG

Представьте сотрудника с доступом к архиву. Наизусть он ничего не помнит, зато знает, где искать: находит нужные папки, пролистывает и отвечает со ссылкой на документ. RAG работает так же, только быстро.

Сначала подготовка. Все документы режут на небольшие куски, по абзацу-два. Каждый кусок превращают в набор чисел, который отражает его смысл, это называется эмбеддинг. Эмбеддинги складывают в специальную базу, её обычно называют векторной.

Когда приходит вопрос, его тоже превращают в эмбеддинг и ищут в базе куски с близким смыслом. Ищут именно по смыслу, совпадение слов тут не обязательно. На вопрос «сколько дней отпуска у меня есть» найдётся абзац «ежегодный оплачиваемый отдых составляет 28 календарных дней», хотя слова «отпуск» в нём нет.

И наконец ответ. Модели передают вопрос, найденные куски и инструкцию: отвечай только по этим фрагментам и укажи, откуда взял.

Зачем компаниям RAG

Самая понятная польза в свежести. Обновили прайс, обновили базу, и переобучать модель не нужно. Вторая польза во внутренних знаниях: регламенты, история обращений в поддержку, техническая документация, всё, чего нет в интернете. Третья в проверяемости. Ответ можно сверить, потому что видно, из какого документа он взят. И выдумок становится меньше: когда нужный текст лежит у модели перед глазами, сочинять ей незачем.

Где RAG уже применяют

Чат-боты поддержки, которые отвечают по базе знаний, и поиск по внутренней вики компании. Помощники для юристов, которые находят нужный пункт в сотне договоров. Поиск в интернете внутри чат-ботов тоже RAG, просто база здесь весь интернет, и поэтому такие ответы приходят со ссылками.

Слабые места RAG

RAG часто продают как лекарство от галлюцинаций. Мы бы назвали это сильным преувеличением. Слабых мест три, и все знакомы любому, кто внедрял такие системы.

Первое и главное: поиск промахнулся. Если нужный кусок не нашёлся, модель ответит по памяти или по неподходящему тексту. Большая часть ошибок RAG-систем это ошибки поиска, модель тут ни при чём. Второе: плохо нарезанные документы. Таблица, разрезанная пополам, или ответ, разбросанный по трём разделам, теряются при поиске. Третье: противоречия. Если старая и новая версия регламента лежат рядом, модель может взять любую и будет уверена в ответе.

Как внедрить RAG в компании

Начните с уборки документов. Удалить устаревшие версии и дубли даст больше, чем выбор самой умной модели. Потом соберите от 50 до 100 реальных вопросов с правильными ответами и прогоняйте систему по ним после каждого изменения, иначе вы не поймёте, стало лучше или хуже. Требуйте ссылку на источник в каждом ответе, это дисциплинирует и систему, и пользователей.

Отдельно про закон. Если в документах есть персональные данные, модель и база должны работать там, где это разрешает 152-ФЗ. Проще всего российское облако или собственный сервер. Как запустить модель у себя, мы рассказали в гайде по локальным нейросетям, а что вообще не стоит отдавать в облачные сервисы, вот здесь.

Частые вопросы о RAG

Чем RAG отличается от дообучения модели?

Дообучение меняет саму модель и её манеру, а знания в ней устаревают с каждым новым документом. RAG модель не трогает и просто подкладывает ей нужные тексты в момент вопроса. Для фактов, которые часто меняются, RAG почти всегда проще и дешевле.

Сколько документов можно подключить?

Технически миллионы. На практике ограничение в качестве: чем больше мусора и дублей в базе, тем чаще поиск будет находить не то.

А если просто вставить все документы в большое контекстное окно?

Для десятка документов это работает. Для тысячи будет дорого и медленно, а детали из середины длинного текста модели теряют. Подробнее в разборе про токены.

Пробовали подключать нейросеть к своей базе знаний? Что пошло не так в первый раз?

Птичка messgo спрашивает, как вам материал

Как вам материал?

Поделиться

Читайте также

Комментарии

Написать комментарий

Без регистрации: имя и почта не нужны, мы подпишем вас случайным именем. Комментарий появится после проверки редакцией.