Retrieval-augmented generation означает, что система сначала ищет по вашему контенту, а потом пишет ответ, используя только найденное, с приложенными источниками. Модель отвечает не по памяти, а по вашим документам — именно это делает вывод проверяемым и поддерживает его в актуальности, когда документы меняются.
В этом вся идея. Всё остальное — стратегии нарезки, эмбеддинги, реранкеры, гибридный поиск — детали реализации ради одного: положить перед моделью правильные фрагменты до того, как она начнёт писать.
Спросите, что люди на самом деле делают, когда сегодня терпят неудачу. Если они знают, что документ существует, и не могут его найти, проблема в поиске и находимости, и хорошо настроенный поиск по хорошо размеченному контенту будет быстрее, дешевле и понятнее в доверии.
Если документы они находят, а ответить всё равно не могут — потому что ответ требует прочитать четыре договора и сравнить их пункты о расторжении, — это тот случай, ради которого RAG и строили. Система читает все четыре и показывает, откуда взялась каждая часть ответа.
Поиска достаточно, когда: ответ лежит в одном известном документе, терминология единообразна, а корпус хорошо структурирован.
RAG отрабатывает стоимость, когда: ответ охватывает несколько документов, одно и то же понятие в них названо по-разному или пользователь не может назвать, что ищет.
Не поможет ни то, ни другое, когда: контент устарел или противоречив. Оба подхода добросовестно достанут неверный ответ, который лежит у вас в файлах.
Обычно предполагают, что качество ответа следует за моделью. На практике оно следует за поиском фрагментов. Если нужного фрагмента нет в контексте, ни одна модель не вытянет; если есть — большинство современных моделей дадут хороший ответ.
Поэтому работа концентрируется на неэффектном конце: как документы нарезаны, как обрабатываются версии, чтобы отменённая политика не отвечала как действующая, как соблюдаются права доступа, чтобы поиск никогда не вернул то, что спрашивающему видеть нельзя, и как система ведёт себя, когда не нашла ничего релевантного. Последнее важнее, чем звучит: система, которая говорит «я это не нашла», заслуживает доверия; та, что всё равно выдаёт правдоподобный абзац, разрушает его за неделю.
Для всего, что используется в профессиональном или регулируемом контексте, результат — не ответ, а ответ вместе с происхождением. Документ, версия, пункт. Юрист, аудитор или специалист по урегулированию не могут действовать по неатрибутированному абзацу — и не будут.
Это к тому же переводит режим отказа из опасного в безобидный. Со ссылками неверный ответ ловится за секунды тем, кто проверяет источник. Без них он повторяется в письме клиенту.
Корпус, у которого есть владелец. Кто-то должен решать, что авторитетно, а что отменено. Это решение не автоматизируется.
Уже существующие права доступа. Поиск обязан наследовать вашу модель доступа. Строить её в ходе проекта — работа существенно большая.
Набор для оценки. Тридцать-пятьдесят реальных вопросов с известными правильными ответами, написанные до запуска. Так вы отличаете настройку от угадывания.
Путь обновления. Документы меняются. Если переиндексация ручная, в течение квартала она перестаёт происходить.
Мы используем cookie только для аналитики — чтобы видеть, с каких страниц приходят заявки. Ничего больше и ничего до вашего согласия. Политика cookie