Дообучение LLM на ваших данных: точность +34%, скорость ×4 vs GPT-4 на узких задачах.
LoRA fine-tuning и дообучение LLM моделей на своих данных: Llama 3, Qwen 2.5, YandexGPT, GigaChat, Mistral. Обучение нейросети на ваших регламентах, переписках, документации. On-premise или в вашем приватном Yandex Cloud.
+34 п.п. точности
На узких задачах (классификация документов, диалоги поддержки, генерация по корпоративному тону) дообученная Llama 3 8B обгоняет GPT-4 на 34 п.п. и стоит в 10 раз дешевле.
Данные не уходят наружу
Обучение нейросети на своих данных идёт на вашем сервере или в вашем приватном Yandex Cloud. Корпоративная переписка, регламенты, переписки клиентов - не покидают ваш периметр.
Экономия 87% vs API
Один раз дообучить + развернуть on-premise дешевле, чем годами платить за токены OpenAI. Окупаемость 4-9 месяцев на потоках от 500 тыс. запросов в месяц.
Fine-tune - это маленькая модель, которая на вашей задаче бьёт большие
GPT-4 и Claude умеют всё, но на любую узкую задачу - дороже, медленнее и иногда хуже специализированной модели. На типовой запрос вы платите 0,03 $ за токен, ждёте 4-8 секунд ответа, и корпоративные данные идут в OpenAI/Anthropic.
Дообучение LLM моделей на своих данных меняет картину: Llama 3 8B или Qwen 2.5 7B после LoRA fine-tuning на 1-5 тыс. размеченных примеров вашей задачи бьют GPT-4 по точности на узкой нише. При этом крутятся на одной A100 или даже на RTX 4090.
Подходит для: классификации документов и тикетов, корпоративного ассистента в вашем тоне, RAG по вашей базе знаний, генерации отчётов по шаблону, разметки текстов, извлечения сущностей. Любая задача, где нужна узкая экспертиза + конфиденциальность данных.
Шесть шагов от «у нас есть сырые данные» до «модель в продакшене»
Каждый шаг настраивается под вашу задачу: классификация, ассистент, генерация, разметка. Полный цикл вместе с вашим in-house ML-инженером или под ключ.
Уточняем, нужен ли вам fine-tune вообще
Иногда хватает RAG или промпт-инжиниринга. Дообучение нужно когда есть стиль/доменная лексика, узкие форматы ответа.
Готовим обучающую выборку
Парсим ваши данные (логи, переписки, документы), размечаем в JSONL формате instruction/input/output. 80/10/10 на train/val/test.
Выбираем базовую модель
Под русский домен: Llama 3, Qwen 2.5, Saiga, Vikhr, T-Lite. Под код: DeepSeek-Coder. Размер 7-13B - оптимум по цена/качество.
LoRA fine-tuning на A100
3-5 эпох на 1-5к примеров, rank 8-32. Loss падает, точность на val растёт. 4-12 часов обучения на одной A100.
Бенчмарк vs GPT-4 и базовая модель
Считаем метрики на тестовой выборке: accuracy, F1, BLEU/ROUGE. Параллельно люди оценивают качество слепо: ваша модель vs GPT-4.
Деплой на ваше железо
vLLM или Ollama для инференса. REST API совместимый с OpenAI. На RTX 4090 - до 100 токенов/сек, на A100 - до 300.
Точность по разным задачам после fine-tune
Замер по нашим проектам: классификация документов, помощник по коду, RAG, разметка. Метрика - accuracy на hold-out test.
Где Fine-tune уже работает
Четыре сценария из разных отраслей. Конкретные модели, метрики, экономика по нашему потоку проектов.
Классификация обращений в поддержку
Банк, 14 тыс. обращений в день. GPT-4 через API стоил бы 8-12 млн ₽/мес. Дообучили Llama 3 8B на 14 тыс. исторических обращений с разметкой по 24 категориям.
RAG-ассистент по регламентам
Завод, 2 800 регламентов и ТУ. Saiga 7B + LoRA на 1 700 пар «вопрос-ответ» из истории обращений в техотдел. Бот в Telegram у мастеров смены.
Извлечение сущностей из договоров
Стороны, суммы, сроки, гарантии, штрафные санкции из договоров любого формата. Qwen 2.5 7B + LoRA на 3 200 размеченных договоров.
Генерация в тоне бренда
Контент-команда писала посты в 3 разных стилях для разных клиентов. Дообучили T-Lite на 5 500 примерах постов каждого бренда. Сейчас драфты автомат, копирайтер только редактирует.
Подберём модель и стратегию fine-tune под вашу задачу
30-минутный разбор. Смотрю ваши данные, домен, требования. На выходе - выбор базовой модели, оценка размера датасета и экономика проекта.
От первого звонка до модели в продакшене - 3-6 недель
Без академических презентаций. Беру ваши сырые данные, договариваемся об объёме разметки, обучаю и деплою. Не абстрактный «AI», а конкретная модель под конкретную задачу.
Постановка задачи
Смотрю ваши данные, домен, инфраструктуру. Решаем: fine-tune или хватит RAG/промптов. Подбираем базовую модель.
Датасет и разметка
Собираем 1-5 тыс. примеров в JSONL. Если разметки нет - привлекаем разметчиков или генерим синтетику + ваша валидация.
Обучение и валидация
LoRA fine-tuning на A100, hyperparam sweep. Метрики на val, человеческая оценка vs GPT-4. Итерируем до нужной точности.
Деплой и передача
vLLM/Ollama на ваше железо, REST API. Передаю Jupyter-ноутбуки, чек-листы, скрипты переобучения. Поддержка по запросу.
Что говорят клиенты
Три отзыва от CTO и ML-руководителей, у которых дообученные модели работают в продакшене минимум полгода.
Платили за OpenAI почти 11 млн ₽ в месяц на классификации тикетов. Дима подсчитал, что Llama 3 8B + LoRA на нашем датасете даст ту же точность. Через 6 недель развернули on-premise, счёт OpenAI упал в 8 раз. Окупилось за 7 недель.
У нас режимные требования - ничего наружу. RAG-ассистент по регламентам на Saiga 7B крутится на собственной A100. Мастера спрашивают «как поступить если течёт фланец на участке 3», бот отвечает с цитатой регламента и номером ТУ.
Юристы тратили по 90 минут на первичный анализ нового договора - выписать стороны, сроки, суммы, гарантии. Qwen 2.5 7B после дообучения на 3 200 наших договоров делает это за 7 секунд с F1=0,94. Юрист сразу к комментариям.
Посчитайте, сколько экономит fine-tune vs API
Подвигайте ползунки - покажу грубо, сколько вы платите OpenAI в месяц и сколько сэкономит дообученная модель на вашем сервере.
Не обещание, а порядок величины. На разборе берём ваши реальные объёмы запросов и структуру нагрузки.
Что обычно спрашивают
Когда нужен fine-tune, а когда хватит RAG?
RAG (поиск + LLM) подходит, когда нужно отвечать по вашей базе знаний фактически. Fine-tune нужен, когда модель должна писать в вашем тоне, в узком формате, использовать доменную лексику, или работать с нетекстовыми форматами (код, JSON, специфический язык). Часто работают вместе: fine-tune для стиля + RAG для фактов.
Сколько данных нужно для LoRA fine-tuning?
Минимум 200-500 размеченных примеров для узкой классификации, 1-3 тыс. для инструкций и диалогов, 5-10 тыс. для генерации в стиле/тоне. Качество разметки важнее количества: 500 хорошо размеченных побеждают 5 тыс. шумных. Если разметки нет - помогаем с генерацией синтетики и валидацией.
Какие модели чаще всего дообучаете?
Для русского: Llama 3.1/3.2 (8B), Qwen 2.5 (7B), Saiga (7B), Vikhr (7B), T-Lite (7B), YandexGPT 5 Lite (через их API). Для англоязычных задач: Llama 3.1, Qwen, Mistral. Для кода: DeepSeek-Coder, Qwen-Coder. GigaChat - через API Сбера, fine-tune ограничен. Подбор - под бюджет и инфраструктуру.
Сколько стоит обучение нейросети?
Базовый цикл fine-tune (датасет 1-3 тыс., 1 модель, LoRA): 480-720 тыс. ₽. Сложный кейс (5+ тыс. примеров, синтетика, мультиэпоха, бенчмарки vs GPT-4): 800-1400 тыс. ₽. Аренда A100 на цикл обучения: 15-40 тыс. ₽. Окупаемость для объёмов 200 тыс.+ запросов в месяц - 3-6 месяцев.
На каком железе крутится модель после fine-tune?
Llama 3 8B / Qwen 2.5 7B после квантизации (Q4-Q5): RTX 4090 24 ГБ ($1800), скорость 50-100 ток/сек. Без квантизации: A100 40 ГБ или 2× RTX 4090. Аренда A100 в Yandex Cloud / Selectel: 110-160 тыс. ₽/мес. Для 13B модели нужно больше железа, обсуждаем под задачу.
Можно ли дообучить YandexGPT или GigaChat?
YandexGPT 5 поддерживает fine-tune через API Yandex Cloud Foundation Models - быстро, но вы привязаны к их облаку. GigaChat - ограниченный fine-tune через Сбер AI Studio. Если нужна полная независимость и on-premise - идём через open-source модели (Llama, Qwen). Под каждый случай советуем оптимальный вариант.
Что с конфиденциальностью данных?
Полностью on-premise: данные не покидают ваш периметр, аренда GPU - на ваших мощностях или Selectel с NDA. Если используем Yandex Cloud / Selectel Cloud - подписываем DPA, данные в РФ, выделенный namespace. Для банков и ВПК - обучение на вашем железе, мы даже не имеем удалённого доступа.
Как сравниваете с GPT-4 или Claude?
На test-set из ваших данных (никогда не видели в обучении) гоняем три модели: GPT-4 через API, Claude через API, наша fine-tuned. Метрики: accuracy/F1 для классификации, BLEU/ROUGE для генерации, human eval для стиля. На узких задачах часто бьём GPT-4 по точности и всегда - по скорости и стоимости.
Кто будет переобучать модель потом?
Можем мы - контракт на квартальные обновления (45-90 тыс. ₽). Можете вы - передаём датасет, скрипты обучения, Jupyter-ноутбуки, инструкцию в markdown. ML-инженер уровня middle справится сам. Часто берут на поддержку первые 6-12 месяцев, потом переводят in-house.
Что если модель после fine-tune работает хуже GPT-4?
В договоре фиксируется измеримая цель: точность на ваших данных не хуже GPT-4 на X%. Если не удалось - дорабатываю за свой счёт (другая модель, дополнительный датасет, иные гиперпараметры). Деньги возвращаются, если расхождение больше 30% и причина в реализации.
Подберём модель и посчитаем экономику fine-tune
30 минут разбора: смотрим ваши данные, домен, инфраструктуру. Считаем экономику vs API и выбираем базовую модель. Без академических лекций.