RAG-система - это ИИ-помощник, который отвечает на вопросы по документам вашей компании и показывает, из какого файла взял ответ. Модель не дообучается, она перед каждым ответом получает найденные фрагменты ваших документов. Запуск на 5-15 тысяч документов и 20-50 пользователей стоит в моих проектах от 320 до 500 тысяч рублей, поддержка 25-40 тысяч в месяц. Для задач поменьше (300-500 документов, 5-7 человек) бюджет 180-280 тысяч. Окупается система там, где сотрудники теряют на поиск больше 100 тысяч рублей в месяц.
Я внедряю такие системы и вижу, как о них думают руководители. Одни ждут "ChatGPT, который знает всё про нашу компанию" за 50 тысяч. Другие слышали, что это стоит миллионы. Правда посередине и зависит от состояния ваших документов. Ниже объясняю, что внутри, что входит в цену и когда лучше не начинать. Если нужна готовая работа, у меня есть страница RAG-системы под ключ.
Один реальный проект с цифрами по срокам и метрикам я уже описал: поиск по 12 000 документов юридической фирмы. Здесь я его не пересказываю. Цель этого текста другая: дать руководителю общую картину и калькулятор бюджета.
Что такое RAG-система простыми словами
Аббревиатура расшифровывается как Retrieval-Augmented Generation: генерация ответа с подтягиванием найденной информации. Если отвечать на вопрос "rag система что это" одной фразой, то это связка из поиска и языковой модели. Сначала поиск находит в ваших документах нужные куски. Потом модель читает их и пишет ответ своими словами.
Представьте нового сотрудника, которому дали доступ к архиву и сказали: "Ответь клиенту по договору, который мы подписывали в 2021 году". Он сначала идёт в архив, достаёт нужные страницы, читает и только потом отвечает. Без архива он бы отвечал по памяти и мог бы выдумать. RAG устроен так же: модель не помнит ваши документы, она каждый раз их перечитывает.
Это отличает RAG от дообучения. При дообучении модель меняют, чтобы она "запомнила" ваши данные. Это дороже, медленнее и плохо работает на документах, которые часто меняются. Подробное сравнение есть в отдельном материале: fine-tuning или RAG, что выбрать. Коротко: для знаний компании в 9 случаях из 10 берут RAG.
Хабр описывает ту же идею так: RAG даёт модели актуальную информацию из внешних источников без переобучения. Это решает три проблемы: модель не знает ваших данных, её знания устарели, она придумывает факты. Третью проблему RAG снижает, но не убирает полностью, об этом ниже.
Схема RAG-системы: из каких блоков она состоит
Когда спрашивают про схему RAG системы, обычно рисуют пять-шесть квадратиков. Для руководителя полезнее смотреть на них как на статьи бюджета. Каждый блок стоит денег и может сломаться.
1. Загрузка документов. Система забирает файлы из файловой шары, почты, облачных дисков, CRM, базы знаний. Читает PDF, Word, Excel, HTML. Если документ - скан без текстового слоя, его сначала прогоняют через распознавание текста. У меня под это есть отдельный продукт: распознавание документов с ИИ. Это самый недооценённый блок. Плохие сканы, дубли и устаревшие версии дают плохие ответы, как бы хороша ни была модель.
2. Разбиение на фрагменты. Документ режут на куски. Хабр называет оптимальным размер 500-1500 символов. Слишком мелкие куски теряют контекст, слишком крупные размывают поиск. Договор лучше резать по пунктам, регламент по разделам, переписку по сообщениям. К каждому куску добавляют метки: название документа, дату, автора, тип, уровень доступа.
3. Векторный поиск. Каждый фрагмент превращается в набор чисел, в котором закодирован смысл. Такой набор называют эмбеддингом. Числа хранятся в векторной базе. Когда сотрудник задаёт вопрос, он тоже превращается в числа, и система ищет ближайшие по смыслу фрагменты. Поэтому запрос "как оформить возврат за брак" найдёт абзац "порядок обработки претензий по качеству", хотя общих слов там нет. Обычный поиск по ключевым словам этого не умеет.
4. Языковая модель. Найденные фрагменты вместе с вопросом отправляются в LLM. Она формулирует ответ и ставит ссылки на источники. Это может быть облачная модель (GigaChat, YandexGPT) или локальная на вашем сервере. Выбор влияет и на цену, и на безопасность данных.
5. Права доступа. Бухгалтер не должен получать фрагменты из документов по зарплатам руководства, а менеджер одного клиента не должен видеть договоры другого. Фильтр прав работает до выдачи фрагментов модели, а не после. Если его пропустить, система станет самой удобной дырой в безопасности компании. Этот блок чаще всего выпадает из дешёвых предложений.
6. Интерфейс и контроль качества. Окно чата или поиска, куда люди пишут вопросы, плюс журнал запросов и набор тестовых вопросов, на которых проверяют качество после каждого изменения. Без тестового набора вы не узнаете, что система стала отвечать хуже.
Вокруг этих блоков есть смежная техника. Например, память ИИ-агентов строится на тех же векторных базах, но решает другую задачу.
Какие задачи решает RAG, а какие нет
Эта часть экономит больше всего денег. Половина неудачных проектов, которые я видел, начиналась с ожидания, что RAG умеет то, чего он не умеет.
Хорошо решает:
- Поиск по смыслу в большом архиве: договоры, регламенты, письма, технические описания, переписка с клиентами.
- Справочник для сотрудников: отпуск, командировки, правила закупки, скрипты продаж. Новичок получает ответ с ссылкой на документ, а не пишет в чат старшему коллеге.
- Помощь поддержке: оператор вводит вопрос клиента и видит подходящий абзац из инструкции.
- Подбор похожих кейсов, прецедентов, прошлых коммерческих предложений.
- Ответы по техдокументации: каталоги оборудования, паспорта изделий, нормативы.
Решает плохо или не решает:
- Подсчёты и сводки по всей базе. Вопрос "сколько договоров с отсрочкой больше 60 дней мы заключили за год" RAG не посчитает. Он найдёт несколько похожих фрагментов и выдаст правдоподобную цифру. Для таких вопросов нужна таблица данных или отчёт в учётной системе, а ИИ можно подключить поверх них. Об этом пишут и зарубежные инженеры: векторный поиск возвращает несколько самых близких фрагментов и не видит данных, разбросанных по сотням документов.
- Генерация документов по образцам. Юристы на моём пилоте переписывали до 80% текста, и быстрее было писать с нуля.
- Структурированные шаблоны. Им нужна вики или каталог с понятной навигацией.
- Задачи, где цена ошибки высока и нет человека для проверки.
Про ошибки. RAG снижает число выдуманных ответов, но не обнуляет его. Исследователи Стэнфорда проверили коммерческие юридические RAG-инструменты. По результатам, которые пересказывает обзор AI Law Librarians, Lexis+ AI давал выдуманные или искажённые ответы в 17% случаев, Westlaw AI в 33%. Это продукты крупнейших вендоров, а не самодельные поделки. Вывод для руководителя: ссылки на источники в каждом ответе и проверка человеком обязательны. У меня это условие закладывается в проект с первого дня.
Сколько стоит создание RAG-системы: бюджет запуска по статьям
Дальше цены. Они из моих проектов в 2025-2026 годах и сверены с рыночным обзором. Чтобы не было путаницы: я считаю в рублях, без НДС, для типовой задачи. Это 5-15 тысяч документов, 20-50 пользователей, веб-интерфейс, разграничение прав, российская модель.
| Статья бюджета | Что входит | Типичная вилка, тыс. руб. |
|---|---|---|
| Аудит документов и чистка | Подсчёт форматов, дубли, устаревшие версии, решение, что загружать | 60-100 |
| Парсеры и индексация | Чтение форматов, разбиение, метки, векторная база | 50-80 |
| Распознавание сканов | Только если в архиве есть сканы без текста | 0-100 |
| Интерфейс и вход | Веб-окно, ссылки на оригиналы, авторизация через корпоративную почту или каталог | 80-120 |
| Права доступа и журнал | Матрица прав, фильтры, лог запросов | 40-70 |
| Тестирование качества | Набор вопросов с эталонными ответами, подбор настроек | 40-60 |
| Обучение пользователей | 2-4 встречи по группам ролей | 20-40 |
Сумма по типовому проекту выходит 320-500 тысяч. Максимальные значения по каждой строке одновременно встречаются редко. Если ваш архив чистый и без сканов, ближе к нижней границе. Если сканы 2015 года и хаос в правах, к верхней. Отдельно клиент платит за свою инфраструктуру: сервер или облако и пакеты распознавания, обычно 20-40 тысяч на старте.
Рынок считает иначе, потому что смотрит на более крупные проекты. По обзору AI Market Rating, пилот на 50-200 документов у интеграторов стоит 500 тысяч - 1,5 миллиона рублей, полный production с интеграциями и оценкой качества 3-10 миллионов за 6-9 месяцев. Там же есть важная цифра: 60-70% бюджета уходит не на чат, а на подготовку данных, безопасность и оценку качества. Мой опыт совпадает. Нейросеть в смете самая дешёвая строка.
Предложение за 100-150 тысяч с обещанием "RAG за неделю" почти всегда означает, что нет аудита, нет прав доступа и нет тестирования. Демо такое работает. На десятом дне реальной работы оно начинает отвечать про чужие документы или не находить свежие.
Для малых задач цена другая. Если у вас 300-500 документов (регламенты, прайсы, инструкции) и команда из 5-7 человек, достаточно готовой платформы с загрузкой файлов и простой настройкой. Это 180-280 тысяч с подготовкой, и права доступа там проще. Стоит ли идти в такие проекты, зависит от ответа на вопрос из последнего раздела.
Сколько стоит поддержка и ежемесячная работа
После запуска деньги продолжают уходить. Это обычно стоит от 25 до 40 тысяч рублей в месяц на проект среднего размера, плюс прямые расходы. Разберу, из чего складывается месячный счёт.
Сервер или облако. В моём проекте для 12 тысяч документов хватило аренды у российского хостера: 8 ядер, 32 ГБ памяти, 500 ГБ NVMe, 14 тысяч рублей в месяц. У векторной базы Qdrant есть бесплатный тариф с 0,5 vCPU, 1 ГБ памяти и 4 ГБ диска, но он создан для прототипов. Это зарубежный сервис, и для персональных данных он не подходит, об этом в разделе про облако.
Эмбеддинги. Это почти бесплатно. Модель эмбеддингов Сбера стоит 14 рублей за миллион токенов. Архив из 12 тысяч документов по 3 тысячи токенов в среднем это 36 миллионов токенов, то есть около 500 рублей за индексацию. Дороже работа людей, а не токены. Пересчитывать приходится при смене модели или при крупных добавлениях.
Языковая модель. Это главная переменная часть счёта. По тарифам Yandex AI Studio входные токены YandexGPT Lite стоят 0,2 рубля за тысячу, YandexGPT Pro 5 - 1,2 рубля за тысячу. Один вопрос с пятью найденными фрагментами это примерно 4 тысячи входных токенов, то есть от 0,8 до 5 рублей плюс выходные токены. Если 50 человек задают по 10 вопросов в день, это около 11 тысяч запросов в месяц. По моим проектам API-часть выходит 8-30 тысяч в месяц, в зависимости от модели и длины ответов. Цены меняются, перед расчётом смотрите актуальные страницы тарифов.
Работа подрядчика. Мониторинг, обновление индекса при добавлении документов, правка плохих ответов по журналу запросов, обновления моделей. Это 15-25 тысяч в месяц из общей вилки. Крупные внедрения обходятся дороже. Тот же обзор AI Market Rating называет 150-500 тысяч в месяц, но речь там о корпоративных системах с тысячами пользователей.
Самый дорогой путь к поддержке - собственная команда. Автор материала на Хабре о реальной стоимости GenAI в продакшене называет главной скрытой статьёй зарплаты: на сопровождение нужны два-три специалиста, а зарплаты ML-инженеров в Москве идут от 260 до 450 тысяч и выше. Для компании на 50 человек это почти никогда не оправдано.
Облако или свой сервер: что выбрать
Вариантов три, и разница заметна и в цене, и в рисках.
| Вариант | Где хранятся данные | Плюсы | Минусы |
|---|---|---|---|
| Российское облако и API (GigaChat, YandexGPT) | У провайдера в РФ, фрагменты уходят в модель | Дешёвый старт, нет железа, быстрый запуск | Данные покидают ваш контур, зависимость от тарифов |
| Свой сервер, модель по API | Индекс у вас, фрагменты уходят в API | Хранилище под контролем, умеренная цена | Нужен сервер и сопровождение |
| Полностью локально | Всё внутри контура, включая модель | Данные не уходят никуда | Нужны видеокарты, дороже на 30-50% |
Выбор определяют три вещи. Первая - тип документов. Если это публичные регламенты и прайсы, облако подходит. Если коммерческая тайна, адвокатская тайна, медицинские данные, нужен контур. Вторая - персональные данные. По части 5 статьи 18 закона 152-ФЗ запрещено записывать, хранить и извлекать персональные данные граждан РФ с использованием баз за пределами России, кроме случаев из статьи 6. Значит, зарубежные векторные облака и зарубежные модели для документов с ПДн исключены. Подробнее о законе и вариантах я писал в материале как обучить ИИ на данных компании: RAG, дообучение и 152-ФЗ. Третья - объём запросов.
Про третье скажу прямо. Локальная модель нужна не всем, и в малом бизнесе чаще не окупается. Видеокарты стоят дорого, а их надо кормить. Тот же автор на Хабре оценил самостоятельный хостинг на 8 видеокартах A100 в 3,17 миллиона рублей в месяц для нагрузки в миллион запросов, это экстремальный сценарий, но порядок понятен. Локальный вариант оправдан, когда данные нельзя отдавать вообще или запросов так много, что API становится дороже сервера. Реальные расчёты я разобрал в статье локальные LLM на своём сервере: где есть смысл, а под ключ такие установки делаю на странице локальные LLM на вашем сервере.
Моя практическая схема для средней компании: индекс и права на своём или арендованном российском сервере, генерация ответа через российский API, а чувствительные документы вынесены в отдельный индекс с локальной моделью. Так выходит дешевле полностью локального варианта и безопаснее чистого облака.
Как сделать RAG-систему: свои силы или подрядчик, и сколько это займёт
Создание RAG системы для компании занимает от 4 до 8 недель при стандартной задаче. Из них около трети - аудит и подготовка документов, ещё треть - интерфейс, права и интеграции, остальное - тестирование и обучение людей. Если документы в хаосе, добавьте 2-4 недели.
Свои силы работают в двух случаях. Первый - у вас уже есть разработчики, которые знают Python и базы данных. Второй - нужен небольшой прототип на один отдел. Демо собирается за выходные с помощью открытых библиотек. Проблемы начинаются потом: права доступа, обновление индекса, оценка качества, поддержка. Я три раза приходил восстанавливать такие самодельные системы. Автор Хабра пишет об этом осторожнее: считайте полную стоимость владения за 6-12 месяцев, а не цену токенов.
Подрядчик нужен, когда вы не хотите держать команду и у вас важны безопасность и сроки. Вопросы, которые стоит задать любому исполнителю до договора:
- Что входит в аудит документов, и кто принимает решение, что загружать.
- Как устроены права доступа: фильтр до модели или после.
- Как измеряется качество: есть ли тестовый набор вопросов и кто его составляет.
- Куда уходят данные: какой облачный API, где физически стоит база.
- Что происходит, если документы обновились: кто и как пересобирает индекс.
- Кому принадлежат исходный код и индекс после завершения проекта.
Если исполнитель на половину вопросов отвечает "это настроим потом", вы покупаете демо, а не систему. Помощь с выбором и аудитом готовых предложений входит в мои проекты по внедрению ИИ под ключ. А если вам нужен не поиск по документам, а агент, который ещё и выполняет действия в ваших системах, смотрите разработку ИИ-агента.
Как понять, что компании RAG рано
Я часто говорю клиентам "подождите". Это тоже часть работы. Вот признаки, что система вам пока не нужна.
Документов мало. Если у вас 50-100 файлов, которые знают все, достаточно хорошей структуры папок и обычного поиска. Сотрудники сами найдут нужное быстрее, чем вы разработаете систему.
Нет порядка в самих документах. Три версии одного договора, нет понятия, какая актуальна, файлы называются "финал_правки_2". RAG найдёт все три версии и даст противоречивый ответ. Сначала наведите порядок. Это нужно независимо от ИИ и полезно само по себе.
Потери на поиск небольшие. Прикиньте честно: сколько человек ищут информацию, сколько раз в день, сколько минут. Если выходит меньше 100 тысяч рублей в месяц, запуск за 320-500 тысяч окупится слишком долго. Если больше 200-300 тысяч, считать дальше имеет смысл. Для сравнения, Хабр оценивает окупаемость корпоративных RAG-проектов в 6-12 месяцев. В небольших командах с хорошим архивом получается быстрее, у юристов, которых я описывал, вышло четыре месяца.
Задача на самом деле про числа. Нужны сводки по продажам, остаткам, дебиторке? Это отчёты и аналитика, а не RAG. Здесь помогут отчёты в учётной системе, а ИИ можно подключить поверх них.
Нет владельца проекта. Кто-то в компании должен решать, какие документы актуальны, кому что видно, что считать хорошим ответом. Если такого человека нет, система превратится в свалку за полгода.
Данные нельзя трогать вообще. Если по политике безопасности ни один документ нельзя отдавать за контур и нет бюджета на локальную установку, откладывайте. Дешёвого обходного пути здесь нет.
И обратный признак. Если сотрудники регулярно пишут в чат "у кого есть тот договор", новички неделями спрашивают коллег про правила, а уход одного человека оставляет дыру в знаниях, значит, пора. Начинайте с одного отдела и одного типа документов, а не со всей компании сразу. На первом этапе мне достаточно двух-трёх часов разговора и просмотра, что у вас лежит в папках, чтобы назвать вилку бюджета с погрешностью около 20%.
Частые вопросы
Что такое RAG система простыми словами?
Это ИИ-помощник, который перед ответом ищет нужные фрагменты в ваших документах и отвечает на их основе. Модель не обучается на данных, она читает их при каждом вопросе. Поэтому новый документ начинает работать сразу после переиндексации, а не после месяцев дообучения.
Сколько стоит RAG система для компании?
Запуск типовой системы на 5-15 тысяч документов и 20-50 пользователей стоит 320-500 тысяч рублей, поддержка 25-40 тысяч в месяц. Малая задача на 300-500 документов обходится в 180-280 тысяч. Корпоративные внедрения у интеграторов начинаются от 3 миллионов рублей.
Чем RAG системы отличаются от обычного поиска по файлам?
Обычный поиск ищет совпадающие слова, RAG ищет по смыслу и собирает ответ со ссылками на источники. Запрос "договор, где поставщик обязан компенсировать простой" найдёт нужный пункт, даже если слова "простой" там нет. Но для точных значений вроде номера договора обычный поиск надёжнее, и хорошая система использует оба подхода.
Можно ли сделать RAG систему своими силами?
Прототип на один отдел собирается за 1-2 недели силами разработчика. Для рабочей системы нужны права доступа, обновление индекса и тестирование качества, это 4-8 недель и сопровождение. Без своих разработчиков чаще дешевле заказать у подрядчика.
Решает ли RAG проблему галлюцинаций?
Снижает, но не убирает. В исследовании Стэнфорда юридические инструменты на базе RAG ошибались в 17-33% случаев. Поэтому каждый ответ должен идти со ссылкой на документ, а в критичных задачах нужна проверка человеком.
RAG нужен облачный или на своём сервере?
Если в документах есть персональные данные россиян, база должна лежать на территории РФ по статье 18 закона 152-ФЗ. Для коммерческой тайны я рекомендую свой сервер или отдельный контур. Локальная модель добавляет к бюджету 30-50%, поэтому её берут, когда данные нельзя отправлять в API.
Через сколько окупается RAG система?
Если сотрудники теряют на поиск больше 200-300 тысяч рублей в месяц, система окупается за 3-6 месяцев. При потерях меньше 100 тысяч запуск обычно не оправдан. Хабр называет для корпоративных проектов срок 6-12 месяцев.
Близкие темы
RAG-системы под ключ - мои сценарии и цены на готовые проекты. Кейс RAG для юридической фирмы на 12 000 документов - полный разбор одного проекта с цифрами. Fine-tuning или RAG - когда модель стоит дообучать. Локальные LLM на вашем сервере - вариант для закрытого контура. Экономика локальных LLM - где собственное железо оправдано.
Источники
- Хабр - что такое RAG, полный разбор от теории до продакшена
- AI Market Rating - рынок RAG-систем РФ 2026, цены и кейсы
- Хабр - сколько на самом деле стоит GenAI в продакшене
- Сбер - документация модели EmbeddingsGigaR и тариф
- Yandex AI Studio - тарифы на модели и эмбеддинги
- КонсультантПлюс - статья 18 закона 152-ФЗ о персональных данных
- AI Law Librarians - что говорит наука о галлюцинациях в юридическом ИИ
- Qdrant - официальные тарифы Qdrant Cloud
Нужна ли вам RAG-система и сколько она будет стоить?
Опишите задачу: сколько документов, в каких форматах, сколько человек ищут и что для вас критично по безопасности. Дам оценку сроков и бюджета за 24 часа. Бесплатно, до подписания.
Обсудить задачу
Добавить комментарий