Каждый второй разговор с клиентом, который услышал про ИИ, начинается с одного и того же. "Мы хотим обучить модель на наших данных". Дальше выясняется, что данные - это PDF договоров, выгрузки из CRM и переписка в Telegram. И что бюджет, по мнению клиента, должен укладываться в 200 тысяч рублей. И что готовое решение нужно к следующему кварталу.
Хорошая новость: ИИ действительно может работать с вашими данными. Плохая новость: способов сделать это два, они стоят разных денег и решают разные задачи. И путать их - дорого. Тут разберём, когда выбирать fine-tuning, когда RAG, как смотреть на это глазами ЛПР, а не дата-сайентиста.
На пальцах: чем эти штуки отличаются
Fine-tuning (дообучение) - это когда вы берёте готовую большую языковую модель и догоняете её обучение на ваших примерах. Условно, у модели есть мозг с общими знаниями, а вы добавляете специфические рефлексы. Модель учится отвечать в вашем стиле, использовать вашу терминологию, придерживаться вашего формата. Результат - новая версия модели, которая ведёт себя по-вашему.
RAG (Retrieval Augmented Generation) - это когда вы оставляете модель как есть, но прямо в момент ответа подсовываете ей нужные кусочки информации из вашей базы. Сначала система находит релевантные фрагменты документов (это retrieval, поиск). Потом эти фрагменты вместе с вопросом отправляются модели, и она пишет ответ, опираясь на них. Никакого переобучения. Знания живут отдельно от модели.
Простая аналогия. Fine-tuning - это как нанять сотрудника и три месяца его учить вашим процессам. После учёбы он работает быстро и говорит ровно так, как вы хотите. Но когда процессы поменяются, придётся переучивать. RAG - это как нанять умного консультанта и положить ему на стол вашу базу знаний. Он каждый раз сверяется с документами и отвечает. База обновилась - он сразу знает. Но отвечает чуть медленнее, и стиль ответов общий, не ваш.
В реальности 2026 года в большинстве проектов используется и то, и то. Но точкой входа для среднего бизнеса почти всегда оказывается RAG. И это не случайно.
Почему RAG почти всегда первый
Возьмём типового клиента. Сеть медцентров, 6 филиалов, 80 врачей. Хотят, чтобы операторы кол-центра отвечали на вопросы пациентов быстрее. Сейчас оператор лезет в админку, ищет нужный протокол, читает, пересказывает. На один звонок - 4-7 минут только на поиск.
Что им продаёт неопытный подрядчик: "Давайте дообучим модель на ваших протоколах, она будет всё помнить". Звучит красиво. На практике это ловушка. Протоколы у медцентра обновляются раз в месяц. Прайс - раз в неделю. Расписание врачей - каждый день. Каждый раз переобучать модель - это сотни тысяч рублей и недели работы. Через полгода у них будет дообученная модель, которая уверенно отвечает по протоколам прошлого квартала.
Что предлагается грамотно: ставим RAG поверх их базы знаний. Документы лежат в одном месте, обновляются как обычно. Любое изменение появляется в ответах оператора в течение часа. Модель не переобучается, она просто видит свежие документы в момент вопроса. Запуск пилота - 250-350 тысяч рублей, месяц работы. Если выстреливает - расширяем.
Это и есть главный аргумент в пользу RAG для большинства бизнес-задач. Знания меняются. Документы добавляются и устаревают. Цены и условия плывут. Если ваша задача связана с актуальностью, RAG - почти всегда правильный выбор.
В подробном разборе на Хабре приводится показательная цифра: при внедрении RAG в службу поддержки время ответа падает с 10 минут до 8-15 секунд, доля полностью автоматических ответов растёт с 20% до 90%. У разработческих команд RAG поверх документации экономит каждому разработчику 10-20 часов в месяц на поиск информации.
Когда fine-tuning всё-таки нужен
Не везде RAG лучше. Есть задачи, где без дообучения никак.
Первая категория: стиль и формат. Если вам нужно, чтобы модель отвечала в очень конкретной манере (тон голоса бренда, юридический канцелярит, скриптовая структура ответа), RAG этого не даст. RAG отвечает в общем стиле модели. Стиль - это про fine-tuning. Видел один кейс, где банк дообучал модель отвечать клиентам в фирменном стиле колл-центра: с конкретными формулировками вежливости, разрешённой лексикой, обязательной структурой. После дообучения тон стал стабильным, операторы стали тратить меньше времени на правку.
Вторая категория: специфические доменные форматы и узкие термины. У одного юридического бутика после дообучения модель стала корректно работать с их шаблонами договоров и автоматически вставлять номера статей по нужным формам. Это не про знания (знания подтянули RAG-ом), а про умение модели правильно структурировать ответ. Российский разработчик TrueTech приводит кейс банковского чат-бота, где после дообучения GigaChat на 3500 диалогов точность маршрутизации запросов выросла с 71% до 94%, а удовлетворённость клиентов поднялась с 3.2 до 4.1 из 5. Эскалации к операторам упали с 61% до 38%.
Третья категория: классификация и рутинные решения. Если задача - отнести входящее обращение к одной из 12 категорий и направить в нужный отдел, дообучение работает отлично. Модель учится на десятках тысяч примеров и начинает классифицировать как человек, который проработал в саппорте пять лет. На таком сценарии fine-tuning часто экономит в разы больше, чем RAG.
Четвёртая категория: экстремально нагруженные сценарии, где важна скорость и низкая цена за запрос. Дообученная маленькая модель отвечает в 5-10 раз быстрее и дешевле, чем большая модель плюс RAG. Если у вас миллион запросов в сутки и каждый должен отрабатывать за полсекунды, fine-tuning маленькой модели экономит миллионы.
Пятая категория: когда данные нельзя выпускать из контура. Если ваши знания строго конфиденциальны и вы не можете их положить в облачный RAG, иногда проще дообучить локальную модель один раз и катать её на своём сервере. Это сценарий банков, оборонки, регулируемых отраслей. Подробнее тут смежная история - локальные LLM на своём сервере.
Цены: сколько это стоит честно
Тут будет неприятная для многих часть. ЛПР, который привык к ценнику "сделайте чат-бот за 80 тысяч", может поморщиться.
Fine-tuning OpenAI и Anthropic. Стоимость самого обучения GPT-4.1 - около 250-280 рублей за миллион токенов обучающих данных. GPT-4.1 Mini - около 70 рублей за миллион. Datasets для нормального дообучения - это 50-500 тысяч токенов как минимум, чаще больше. То есть само обучение в OpenAI обходится в 5-15 тысяч рублей. Звучит дёшево. Но есть подвох: использовать дообученную модель потом дороже базовой. Inference дообученного GPT-4.1 стоит около 280 рублей за миллион входящих токенов и 1100 рублей за миллион исходящих. Это в 3-4 раза дороже базовой модели за каждый запрос. На объёме в 50 тысяч запросов в месяц разница вылезает в десятки тысяч рублей.
В Azure OpenAI отдельная история: там за хостинг дообученной модели берут почасовую ставку независимо от использования. То есть модель просто висит в облаке и стоит 5-7 тысяч рублей в сутки, даже если в неё никто не пишет. Это нормально для крупного бизнеса с постоянной нагрузкой, но для SMB это ловушка - можно влететь в счёт 150-200 тысяч за месяц простоя.
Fine-tuning российских моделей. YandexGPT в AI Studio позволяет дообучать модели от 10 тысяч рублей за разовое обучение, в зависимости от размера датасета. Использование адаптированной модели на 30-50% дороже базовой YandexGPT Pro. GigaChat от Сбера предлагает fine-tuning только в корпоративных тарифах (GigaChat Pro и Enterprise), цена обсуждается индивидуально - в реальных проектах это 300-700 тысяч на проект плюс стоимость инференса.
Полный fine-tuning под ключ. Если считать честно, с подготовкой данных, экспериментами, проверкой качества, интеграцией - проект дообучения у толкового подрядчика стоит 500-1500 тысяч рублей. Сроки - 5-9 недель. Это диапазон, в котором работают такие компании, как TrueTech, и независимые специалисты. Подробнее у меня тут - fine-tune LLM на ваших данных.
RAG на старте. Простой пилот с одной системой и базой знаний на 100-500 документов - 200-350 тысяч рублей, срок 3-5 недель. Сюда входит: настройка векторной базы (чаще всего pgvector, бесплатный, или Qdrant), embedding-модель, retrieval-пайплайн, интеграция с одной LLM, базовый интерфейс. Подробнее про продукт - RAG-системы под ключ.
RAG корпоративный. Если речь про десятки тысяч документов, RBAC (разграничение доступа на уровне роли сотрудника), интеграцию с несколькими источниками, оценку качества по метрикам и observability - бюджет 700-2500 тысяч на старт, плюс 30-80 тысяч в месяц поддержки. Эту цифру подтверждают и материалы на Хабре: 500-800 тысяч для кастомных систем, от 1-2 миллионов для корпоративных с интеграциями.
Постоянные расходы RAG. Векторная база: pgvector на существующем PostgreSQL - 0 рублей, Qdrant self-hosted - 3-5 тысяч в месяц за VPS, Qdrant Cloud - 8-25 тысяч в месяц. Эмбеддинги через российский API - 2-8 тысяч в месяц при умеренной нагрузке. LLM-запросы (GigaChat Pro, YandexGPT Pro) - 5-20 тысяч в месяц при тысяче запросов в день. Итого ежемесячно 15-60 тысяч для рабочей системы среднего бизнеса.
Таблица сравнения для принятия решения
Чтобы не зарываться в детали, вот матрица, которую я обычно показываю клиентам на первой встрече.
Задача: ответы на вопросы по внутренней документации.
Выбор: RAG. Документы обновляются часто, нужны ссылки на источники, ошибки модели должны быть отслеживаемыми.
Задача: автоматическая классификация обращений на 10-30 категорий.
Выбор: fine-tuning маленькой модели. Высокая скорость, низкая цена за запрос, точность стабильно выше промптинга.
Задача: чат-бот для клиентов с актуальными ценами и услугами.
Выбор: RAG. Цены и услуги меняются, переобучать каждый раз дорого. Опционально - fine-tuning только под стиль ответа.
Задача: генерация документов в строгом корпоративном стиле.
Выбор: fine-tuning под стиль и формат. RAG для подстановки актуальных данных.
Задача: юридический ассистент по договорам компании.
Выбор: RAG как основа. Гибридный поиск (векторы + ключевые слова), обязательный reranker, ссылки на статьи. Fine-tuning только если нужен особый формат заключений.
Задача: воспроизведение голоса конкретного эксперта (статьи, посты).
Выбор: fine-tuning. Это про стиль, формулировки, любимые обороты. RAG тут не поможет.
Задача: техподдержка с базой знаний на 10 тысяч статей и обновлениями каждую неделю.
Выбор: RAG. Огромная база, постоянные обновления, нужны ссылки. Fine-tuning поверх - опционально для стиля.
Задача: ассистент для бухгалтерии с расчётом по налоговому кодексу.
Выбор: RAG плюс контроль человека. Законы меняются, ошибаться нельзя. Никакой полностью автономной модели.
Задача: персональный ассистент-собеседник, который "знает компанию".
Выбор: гибрид. Fine-tuning под тон и манеру, RAG под знания о людях, процессах, истории.
Три истории из практики
История первая. Юридическая фирма, 25 человек. Хотели "ИИ-юрист, который пишет договоры". Сначала пробовали через подписку на одного из российских ИИ-вендоров с дообучением. Загрузили 800 шаблонов своих договоров за пять лет. Дообучение стоило 280 тысяч, заняло три недели. Результат: модель уверенно генерирует тексты, но в 30% случаев придумывает несуществующие статьи закона или искажает реальные. Юристы перепроверяют каждый абзац, экономии нет.
Переделали на RAG. База: те же 800 шаблонов плюс актуальные тексты ГК, НК, КоАП. Модель цитирует конкретные документы, юрист видит источник, легко проверить. Точность подскочила до 95%, время согласования договоров упало на треть. Бюджет полной переделки - 350 тысяч. Окупилось за два месяца. Вывод: знания - в RAG, не в дообучение. Это иллюстрирует и разбор RAG в юридическом домене на Хабре: грамотно настроенный RAG поднимает точность анализа контрактов с 74% до 95%.
История вторая. Ритейлер бытовой техники, 12 магазинов и интернет. Стояла задача: чат-бот в WhatsApp и на сайте отвечает на вопросы по товарам. У них каталог на 18 тысяч SKU, цены меняются раз в неделю, акции - каждый день, новые товары добавляются десятками. Любая попытка дообучить модель упирается в устаревание через неделю.
Поставили RAG: подключили внутренний прайс, описания товаров, FAQ. Векторная база - Qdrant в их облаке. LLM - GigaChat Pro для основной массы запросов, переключение на GigaChat Max для сложных. Бот отвечает с актуальными ценами, остатками, рекомендует похожие товары. Внедрение - 580 тысяч за два месяца. Окупаемость: автоматических ответов 78%, сокращение нагрузки на операторов на 40%. Один оператор закрыт, годовой эффект свыше 700 тысяч. Похожий разбор есть на vc.ru про RAG для бэкофиса и поддержки.
История третья. Региональный банк. Здесь как раз случай fine-tuning, не RAG. Задача: модель отвечает в строгом тоне банка, придерживается утверждённой скриптовой структуры, корректно использует юридические формулировки. База знаний небольшая, обновляется редко (продукты у банка стабильные).
Дообучили GigaChat на 4500 диалогов. Бюджет - 1.1 миллион рублей, срок 7 недель. После запуска оператор кол-центра тратит на формулировку ответа в 4 раза меньше времени, операторам не нужно постоянно сверяться с гайдом по фирменному стилю. Параллельно поставили RAG для актуальных тарифов и условий, но это второй слой, не основной. Тут fine-tuning был правильным выбором, потому что цель - стиль и стабильность, а не свежесть знаний. Этот же подход описан в кейсе про борьбу с галлюцинациями в медицине, где fine-tuning отвечает за стиль и логику, а RAG - за факты.
Гибрид: когда оба подхода вместе
В реальности 2026 года в крупных и средних проектах часто используется и то, и то. По разным оценкам, в продакшен-системах примерно 60% проектов сочетают оба подхода. Логика такая.
Fine-tuning отвечает за стиль, формат, доменный язык. Модель умеет говорить как сотрудник вашей компании - использует правильные термины, знает структуру ответов, понимает контекст профессии.
RAG отвечает за актуальные знания. Модель не пытается "помнить" ваши документы - она каждый раз сверяется с реальным первоисточником. Это убивает галлюцинации.
На практике это выглядит так. Берётся компактная открытая модель (Llama, Qwen, или адаптированная российская). Дообучается под ваш домен и стиль. Дальше эта модель работает за RAG-пайплайном: получает вопрос плюс найденные в базе фрагменты, генерирует ответ. Стиль - ваш, факты - актуальные. Стоимость инференса низкая, потому что модель компактная. Знания обновляются без переобучения.
Минус один: систем не одна, а две. Их обе нужно поддерживать, мониторить, обновлять. Для бизнеса меньше 50 человек это часто избыточно. Для крупного бизнеса с серьёзной нагрузкой - оптимальный сценарий. Альтернативный взгляд на тему есть в моей предыдущей статье - как обучить ИИ на своих данных: RAG или fine-tune.
Безопасность и контур данных
Отдельный разговор - где живут ваши данные. Это вопрос, который часто становится решающим, особенно в регулируемых отраслях.
При fine-tuning через OpenAI или Anthropic ваши обучающие данные временно попадают на серверы вендора. По их политике они не используются для тренировки общих моделей, но физически проходят через зарубежную инфраструктуру. Для банков, медицины, оборонки в РФ это часто стоп-фактор.
YandexGPT и GigaChat - данные остаются в российской инфраструктуре, сертификации есть, но всё равно это облако вендора. Полностью изолированный контур - только если разворачивать локальную модель.
RAG в этом смысле гибче. Можно вынести векторную базу в свой контур (pgvector прямо на корпоративном PostgreSQL, Qdrant на своём сервере). Эмбеддинги можно делать локальной open-source моделью. На связь с LLM уходит только запрос и найденные фрагменты, и здесь уже можно выбирать: внешний вендор или своя локальная модель. Если поставить локальную LLM, данные вообще никогда не уходят за периметр компании.
Для регулируемых отраслей это и есть основное преимущество RAG над дообучением: при правильной архитектуре никакие конфиденциальные данные не покидают вашу инфраструктуру. Подробнее про этот сценарий - локальные LLM на своём сервере.
Типовые грабли при внедрении
Грабли первые: переоценка важности дообучения. Клиент уверен, что "наши данные особенные, без обучения никак". Открываем кейсы - в 70% случаев задача отлично решается через RAG. Дообучение нужно реже, чем кажется. Сначала пилот RAG, потом смотрим, чего не хватает.
Грабли вторые: грязная база знаний. Хотите RAG поверх документации? Сначала проверьте, что документация существует и актуальна. Видел кейс, где половина статей в базе устарела ещё в 2022 году. Бот честно цитировал устаревшие правила. Перед запуском RAG - аудит и чистка данных, без этого никак.
Грабли третьи: ожидание "магии" от fine-tuning. Дообученная модель не становится умнее по фактам. Она просто говорит в нужном стиле. Если вы хотите, чтобы она "знала всё про вашу компанию", это про RAG, а не про дообучение. Эту иллюзию ломать приходится почти на каждой первой встрече.
Грабли четвёртые: недооценка стоимости инференса. Дообучили модель за 50 тысяч, радостно подключили к 10 интеграциям. Через месяц счёт от вендора в 200 тысяч за inference. Считать стоимость в продакшене обязательно ДО дообучения, не после.
Грабли пятые: отсутствие метрик качества. Запустили RAG - вроде работает. А насколько? Какой процент правильных ответов? Сколько галлюцинаций? Сколько раз модель сказала "не знаю" вместо того, чтобы выдумать? Без метрик и регулярного контроля система деградирует тихо. У одного клиента точность ответов незаметно упала с 91% до 67% за полгода - просто из-за изменений в формате документов. Нужен мониторинг.
Грабли шестые: путаница с тем, что считать данными. "У нас тонны данных" - открываем, там 30 страниц вики плюс 200 файлов Excel с разными структурами. Это не "тонны данных", это сырьё для долгой подготовительной работы. RAG любит структурированные документы. Excel-вакханалия требует предварительной нормализации, иначе результат будет плачевным.
Что в итоге выбрать
Если у вас задача связана с актуальными знаниями - документация, прайсы, регламенты, база клиентов, переписка, отчёты - почти всегда начинайте с RAG. Дешевле, быстрее, безопаснее, легче поддерживать. На разборе на Хабре авторы прямо называют RAG "одной из самых мощных и универсальных технологий корпоративной автоматизации" именно за способность работать с актуальной информацией без переобучения.
Если у вас задача связана со стилем, форматом, узкой классификацией или экстремальной нагрузкой - смотрите на fine-tuning. И сначала прикиньте бюджет на инференс, не только на обучение.
Если бизнес крупный и задач много - комбинируйте. Маленькая дообученная модель плюс RAG поверх. Это рабочая архитектура 2026 года, она же оптимальна по соотношению цены и качества.
Если у вас сомнения, что важнее - актуальность или стиль - почти всегда выбирайте актуальность. Стилем можно пожертвовать, ошибочными фактами - почти никогда. Пользователь простит сухой тон, но не простит, что ему назвали неправильную цену или просроченное условие.
И главное. Не стоит дообучать ради того, чтобы дообучить. Не нужно ставить RAG, чтобы потом сказать "у нас тоже есть ИИ". Сначала задача, потом подход. Иногда правильный ответ - вообще не fine-tuning и не RAG, а нормальная база знаний с обычным поиском плюс грамотный чат-бот на готовом стеке. Это тоже нормально.
Близкие темы
Как обучить ИИ на своих данных: RAG vs fine-tune - более ранний разбор темы с практическим уклоном. RAG-системы под ключ - продуктовая страница с прайсом. Fine-tune LLM на ваших данных - для тех, кто понимает, что нужно именно дообучение. Локальные LLM на своём сервере - сценарий полностью изолированного контура. YandexGPT vs GigaChat для бизнеса - выбор базовой модели под российский контур.
Источники
- Хабр - что такое RAG-система, полный разбор от теории до продакшена
- Хабр - RAG-системы: принципы работы, архитектура и ограничения
- Хабр - RAG в юридическом домене, от плоских векторов к темпоральным графам
- Хабр - сравнение отечественных и зарубежных LLM, MERA-бенчмарки и цены
- vc.ru - LLM и RAG для внутренних систем поддержки и бэкофиса в 2025-2026
- TrueTech - дообучение GigaChat, цены, сроки, банковский кейс
- Webiomed - Fine-tuning vs RAG в борьбе с галлюцинациями LLM в здравоохранении
- Корус Консалтинг - возможности RAG для работы с корпоративными данными
- OpenAI - официальная страница тарифов API и fine-tuning
- Сбер - официальные тарифы GigaChat API
Не понимаете, что вам нужно: RAG или fine-tuning?
Опишите задачу: какие у вас данные, как часто меняются, что хотите получить от ИИ. Верну рекомендацию с архитектурой, ценой и сроками за 24 часа. Бесплатно, до подписания.
Обсудить задачу
Добавить комментарий