Своя локальная нейросеть на вашем железе. Ни один токен не уходит в OpenAI или GigaChat.
Разворачиваю Llama 3, Qwen 2.5, Yandex YaLM или GigaChat-аналог на вашем сервере. Полная изоляция данных, без абонентки за API, без лимитов RPS. Подходит для банковской тайны, ПДн, медицинских данных и любых случаев, где нельзя в облако.
Данные не уходят за контур
Локальная нейросеть на вашем железе - ни один токен не идёт в OpenAI, GigaChat API, YandexGPT. Подходит для банковской тайны, медицинских данных, ПДн, гостайны, кейсов где NDA с контрагентом запрещает облако.
Без абонентки за API
На объёмах 100к+ запросов/мес GigaChat API стоит 300-800 тыс. ₽/мес, OpenAI - 600 тыс. - 2 млн. Локальная LLM окупает железо за 5-9 месяцев при высокой нагрузке. Потом - только электричество.
Дообучение на ваших данных
LLM обучение fine-tuning на ваших регламентах, документации, истории диалогов. Модель становится экспертом по вашему домену, не знает чужого. Без утечки данных через API облачных моделей.
Локальная нейросеть - это ваша инфраструктура, а не подписка на чужое облако
Облачные LLM (OpenAI, GigaChat API, YandexGPT) удобны на старте: подключаешься через REST API, платишь за токены, не думаешь о железе. Но на объёмах и в чувствительных доменах это упирается в три стены: данные уходят к вендору, цена растёт с нагрузкой, лимит RPS режет масштабирование.
Локальная LLM это модель уровня GigaChat / GPT-4 (Llama 3.3 70B, Qwen 2.5 72B), развёрнутая на вашем сервере. Никаких внешних API, никаких токен-лимитов, никакой телеметрии. Полный контроль над весами модели, версиями, dataset'ом для дообучения.
На типичных задачах (RAG, классификация, суммаризация, диалог) модель 32-70B параметров на NVIDIA A100/H100 даёт качество на уровне GigaChat-2 Max или GPT-4o-mini. На узких доменах после fine-tune часто превосходит облачные за счёт глубокого знания вашей специфики.
Шесть шагов между «нам нужна LLM на своём железе» и «запущено, работает»
Каждый шаг - под вашу задачу, ваше железо и ваш контур безопасности. Никаких "коробок за 3 млн с неподдерживаемыми обновлениями".
Определяем кейс и нагрузку
RAG-поиск по корпоративной базе / классификация писем / суммаризация / диалоговый агент / генерация кода. От кейса зависит размер модели (8B / 32B / 70B) и нужное железо.
Выбираем модель под русский язык
Llama 3.3 70B - флагман по универсальности. Qwen 2.5 - лучшая по коду и логике. YaLM 100B - чисто русская модель. GigaChat-OpenSource - аналог в стиле Сбера. Бенчмарки на вашей задаче.
Подбираем GPU под бюджет и нагрузку
Для модели 70B - A100/H100 80GB или связка 2×L40S 48GB. Для модели 8-13B - L40S или RTX 4090. Аренда у Selectel / Cloud4Y / Yandex Cloud, либо закупка под себя - сравниваем TCO.
vLLM / Ollama + REST-обёртка
Разворот через vLLM (production-grade, batched inference) или Ollama (PoC и dev). REST API в стиле OpenAI - чтобы ваш существующий код мигрировал заменой URL. Аутентификация и rate-limiting на уровне gateway.
Дообучение на вашем домене
QLoRA fine-tuning на ваших корпусах: документация, диалоги, регламенты. Через LangChain или LlamaIndex - агенты с инструментами (RAG, поиск, вызов внутренних API). Модель знает вашу специфику.
Prometheus + Grafana, алерты в Telegram
Мониторим latency, RPS, GPU-utilization, температуру карт, OOM. Алерты в Telegram админа на падения и аномалии. SLA 99,5% по договору, типично выходим на 99,8-99,9%.
Локальная LLM vs облачные API на типовых задачах
Замер по клиенту - корпоративный банк, RAG-поиск по 14 тыс. внутренних регламентов, второй квартал эксплуатации.
Где локальные LLM уже стоят на серверах
Четыре сценария из разных секторов. Конфигурация модели, размер железа, какие задачи закрывает.
RAG по регламентам
14 тыс. внутренних регламентов, инструкций, методичек. Сотрудник спрашивает "как открыть счёт нерезиденту-юрлицу" - получает ответ с цитатами и ссылками. OpenAI/GigaChat нельзя - банковская тайна.
Суммаризация осмотров
Расшифровка диктофонной записи приёма врача + краткая сводка в карточку пациента (МИС). Персональные данные не могут уходить в облако - стоит локально на серверах клиники.
Внутренний AI-ассистент
База знаний по оборудованию, инструкциям, регламентам безопасности. Мастер цеха в Telegram спрашивает "как восстановить параметр X на линии Y" - получает ответ с разделом из руководства.
Анализ договоров
Загружает договор, ИИ ищет нестандартные пункты, риски, отсутствующие гарантии. NDA с клиентами не позволяет отправлять тексты в облако.
Подберу железо и модель под вашу задачу
30-минутный разбор. Смотрю задачу, объёмы, требования по безопасности. На выходе - спецификация железа и модели + расчёт TCO vs облачные API.
От первого звонка до боевой локальной LLM - 3-6 недель
Без слайдов и презентаций. Беру вашу задачу, ваше железо или арендованный GPU, ваши данные. Делаю систему, которая работает без меня.
Бенчмарк моделей
Тестирую 3-4 модели (Llama, Qwen, YaLM, GigaChat OSS) на вашей задаче. Замеряю качество, скорость, требования к железу. Подбираю оптимальную под бюджет.
Развёртывание
Арендую или настраиваю ваше железо. Разворачиваю модель через vLLM с REST API в стиле OpenAI. Безопасность: VPN, аутентификация, rate-limiting.
Fine-tune + интеграции
QLoRA-дообучение на ваших данных. RAG через Qdrant / Weaviate. Интеграция с вашими сервисами (CRM, MIS, ERP, телефония) через LangChain.
Передача + SLA
Мониторинг (Prometheus + Grafana + алерты в Telegram). Документация по эксплуатации. Обучение вашего DevOps. Договор поддержки с SLA 99,5%.
Что говорят клиенты
Три отзыва от CIO/CTO компаний, которые эксплуатируют локальные LLM минимум полгода. С цифрами и контекстом.
Мы банк, регламенты в облако отправить не можем. Поставили локальную Llama 70B на две A100, дообучили на 14 тыс. внутренних документов. Сотрудники колл-центра вопросов задают в 3 раза меньше старшим - ИИ быстрее и точнее.
До локалки тратили на OpenAI 240 тыс. ₽/мес и ещё боялись утечки коммерческих данных. Железо A100 окупилось за 7 месяцев, дальше плачу только за электричество. Качество модели Qwen 72B на наших задачах не хуже GPT-4o-mini.
Юрфирма, договоры клиентов - тайна. Нельзя их показывать ни OpenAI, ни GigaChat. Поставили локальную Llama 70B на H100, дообучили на нашей библиотеке договоров за 15 лет. Сейчас типовой анализ договора - 38 секунд, юрист тратит время на спорные пункты.
Посчитайте, окупится ли локальная LLM против OpenAI / GigaChat
Подвигайте ползунки - покажу грубо, сколько стоит ваша задача в OpenAI API за месяц и за сколько окупится локальное железо.
Не обещание, а порядок величины. На разборе берём вашу реальную задачу и считаем под выбранную модель и железо.
Что обычно спрашивают
Какая нейросеть для локалки лучше: Llama, Qwen, YaLM, GigaChat?
Для русского языка топ-3: Llama 3.3 70B (универсальная), Qwen 2.5 72B (лучшая по коду и логике), YaLM 100B (чисто РФ). GigaChat в OpenSource-варианте - неплохой выбор для госсектора. Под конкретную задачу делаю бенчмарк - не все модели одинаково хороши на всём.
А GigaChat от Сбера можно поставить локально?
Сбер выпустил GigaChat-7B и GigaChat-20B в Open Source - их можно поставить на своё железо. Большие версии (GigaChat 2 Max) - только через GigaChat API в облаке Сбера. Для полностью изолированной локалки рекомендую Llama 3.3 или Qwen 2.5 - они стабильнее и лучше документированы.
Какое железо нужно?
Минимум для модели 8B - RTX 4090 24GB (~250 тыс. ₽). Для 32B - NVIDIA L40S 48GB или A100 80GB (~1,1-2,2 млн). Для 70B - A100 80GB или H100 80GB (2,2-4,5 млн). Можно арендовать в Selectel, Cloud4Y, Yandex Cloud - 80-180 тыс. ₽/мес за A100.
Качество хуже OpenAI или GigaChat?
На универсальных задачах Llama 70B / Qwen 72B сопоставимы с GPT-4o-mini и GigaChat-2 Max. На узких доменах после fine-tune на ваших данных - часто лучше облачных моделей (модель знает вашу специфику, не знает чужого "шума"). На сложных задачах вроде анализа изображений или креативного письма - облачные пока впереди.
Что с санкциями на железо NVIDIA?
A100/H100 поставляются в РФ через параллельный импорт (Казахстан, ОАЭ, Армения). Гарантия от дистрибьютора, не от NVIDIA - на 1-2 года. Альтернатива - аренда в Selectel или Cloud4Y, у них флот есть, проблема снята.
Как происходит LLM обучение / дообучение?
QLoRA - метод эффективного дообучения, требует в 4-8 раз меньше памяти. На вашем dataset'е (5-50 тыс. примеров) дообучение модели 70B занимает 2-4 дня на A100. После - сохраняем дообученную модель, разворачиваем как основную. Дообучаем раз в квартал по новым данным.
Что такое llm агенты?
LLM агент - модель, которая может вызывать инструменты (поиск в базе, вызов вашего API, запуск SQL-запроса, чтение файла). Через LangChain или LlamaIndex настраиваем набор tools, агент сам решает, какой использовать в каком шаге. Подходит для сложных диалоговых сценариев.
Сколько стоит развёртывание под ключ?
Зависит от модели и интеграций. Развёртывание Llama/Qwen с REST API + RAG - 380-580 тыс. ₽. С fine-tune на вашем dataset и агентами LangChain - 580-980 тыс. Поддержка с дообучением раз в квартал - 45-85 тыс. ₽/мес. Железо/аренда GPU - отдельно.
SLA и надёжность?
Типовое SLA - 99,5% uptime в месяц (~3,5 часа простоя). На нашем флоте обычно выходим на 99,8-99,9%. При критичности - делаем кластер из 2-3 GPU с балансировкой, тогда SLA можно гарантировать 99,95%.
Что с апдейтами моделей - выйдет Llama 4, нужно ли всё переделывать?
Llama / Qwen / YaLM выходят раз в 6-12 месяцев в новых версиях. Если новая существенно лучше - обновляемся (это плановая работа, обычно 1-2 недели на миграцию + fine-tune). REST API на вашей стороне не меняется, ваш код не трогаем.
Подберу железо и модель под вашу задачу
30 минут разбора: смотрим задачу, объёмы, требования по безопасности и бюджет. На выходе - спецификация и TCO. Без презентаций.