Раз в две недели мне пишет очередной собственник: "Дима, надо поднять свою LLM на нашем сервере. Облако сливает данные, API дорогое, хочу всё своё". Дальше следует разговор минут на сорок, в котором я объясняю, что "своё" в случае с LLM стоит не так дёшево, как кажется по статьям с Хабра, и не так дорого, как пугают облачные провайдеры. Но смысл там есть. Только не везде.

Решил собрать всё в один разбор. Считал реальное железо по российским ценам июня 2026, накладные расходы и считал четыре типовых сценария: микробизнес, средняя компания, юридическая фирма с чувствительными данными и банк с регуляторкой. Где self-hosted LLM окупается, где сжигает деньги, и почему "просто купить RTX 4090 и поставить Saiga" - это не план.

Что считаем "локальной LLM" в 2026 году

Терминология за последний год расплылась. Под "локальной LLM" люди понимают совершенно разное.

Первое - это open-source модель на своём железе. Купили сервер, поставили GPU, развернули Qwen 3 или одну из российских моделей семейства Saiga. Данные не уходят никуда, кроме как внутрь сервера. Это и есть классический self-hosted сценарий, про который дальше будем говорить большую часть текста.

Второе - это аренда GPU в российском облаке у Selectel, Cloud.ru, Т1 Облако, Yandex Cloud. Железо чужое, но физически стоит в РФ, договор по 152-ФЗ заключается, ответственность за обработку персональных данных делится. Это не совсем self-hosted, но многие клиенты называют это "своим" в противовес зарубежным API.

Третье - это API российских вендоров: GigaChat от Сбера, YandexGPT, MTS AI. Никакого железа у вас нет, вы платите за токены. Технически это никакая не локальная модель, но юридически данные не уходят за границу, и часть бизнесов это устраивает. Про сравнение GigaChat и YandexGPT у меня есть отдельная статья.

Дальше под "локальной" буду понимать первый сценарий - своё железо, открытая модель, всё под вашим контролем. Иногда буду сравнивать с арендой облачного GPU, чтобы было видно разницу.

Какие модели вообще можно поставить себе

На середину 2026 года выбор такой.

Семейство Qwen 3 от Alibaba. Qwen 3 30B и Qwen 3 235B - текущие топы в open-source. В русском языке Qwen 3 235B по бенчмаркам подтянулся к уровню GPT-4 Turbo и Claude 3.5 Sonnet, что для открытой модели ещё два года назад звучало как фантастика. Лицензия позволяет коммерческое использование. На Хабре у Selectel есть толковый разбор, как разворачивать Qwen через vLLM. Это самый частый выбор сейчас в проде.

Saiga и Vikhr - русские дообученные версии открытых моделей от исследователя Ильи Гусева и команды Vikhr. По сути это адаптация Llama, Qwen, Mistral под русский язык и российские реалии. Они закрывают условные 90% задач русскоязычного бизнеса (саппорт, классификация документов, базовая генерация текста), причём без необходимости платить за дообучение.

Mistral - французская команда, лицензия позволяет коммерческое использование. Mistral Small, Mistral Large. Хорошо тащит на европейских языках, русский держит средне. Используется реже Qwen, потому что в русском проигрывает.

DeepSeek V3.2 - китайская MoE-модель на 671 миллиард параметров, из которых активны 37 миллиардов. По качеству топ open-source, но требует от 8 GPU H200, что выводит её из бюджета большинства SMB.

Llama 4 от Meta (организация признана экстремистской и запрещена в РФ). Технически модель доступна, лицензия открытая. Юридически коммерческое использование в РФ компанией в плохом месте, и большинство интеграторов её не предлагают. В корпоративных контурах банков и госструктур её просто не пускают. На полузакрытых внутренних проектах встречается, но я бы не рекомендовал. Альтернатив достаточно.

GigaChat и YandexGPT в открытой части. У Сбера есть GigaChat Lite в опенсорсе, но это маленькая модель уровня "пощупать". Полноценный GigaChat - закрытый, доступен только через их API. YandexGPT тоже только через облако. То есть self-hosted в чистом виде это не даст, скорее это инфраструктурная история.

Сколько стоит железо: четыре уровня

Цены июня 2026 года по российским продавцам и интеграторам. Я лично закупал технику этого уровня для клиентов, поэтому числа не из воздуха.

Уровень 1, "домашний сервер". Десктоп на Intel i9 или AMD Ryzen 9, 64 ГБ оперативки, одна RTX 4090 на 24 ГБ или RTX 5090 на 32 ГБ, NVMe SSD на 2 ТБ. Бюджет 250-400 тысяч рублей в зависимости от качества сборки и поставщика. На таком стенде нормально пойдёт Qwen 3 14B, Saiga на базе 8B-13B, Mistral Small. Этого хватит на 1-3 одновременных пользователей и быстрое прототипирование. На реальный прод с десятками пользователей не годится: упирается в VRAM, длинный контекст не вытягивает, тротлит на нагрузке.

Уровень 2, "малый прод". Сервер с одной NVIDIA H100 на 80 ГБ или новой H200. У российских интеграторов готовый сервер с гарантией и поддержкой стоит 2.5-4 миллиона рублей. Плюс электричество около 5 тысяч в месяц при круглосуточной работе, плюс стойка в дата-центре от 20 тысяч в месяц, если дома не держать. На таком сервере крутится Qwen 3 30B с длинным контекстом, обслуживает 20-60 одновременных пользователей через vLLM. Это рабочая лошадка средней компании.

Уровень 3, "корпоратив". Два сервера с H100 или один с двумя-четырьмя H200, кластеризация, резервирование. 8-15 миллионов рублей на стартовое железо. Сюда уже встаёт DeepSeek V3.2 или мощные мультиагентные сетапы. Уровень банка средней руки, крупной юридической фирмы, страховой компании.

Уровень 4, "тяжёлая корпоративка". Кластер 8x H200, нагрузка в десятки тысяч запросов в сутки. 40-60 миллионов рублей. Сюда уже почти никто не идёт, если бизнес не на инфраструктурной деятельности завязан. Большинство задач закрывается уровнем 2 или 3.

Альтернатива покупке - аренда у Selectel. Конфигурация с одной A100 80 ГБ - от 100 тысяч в месяц, с H100 - от 180-250 тысяч в месяц в зависимости от обвязки. По данным аналитики Rutab со ссылкой на SemiAnalysis, аренда H100 в мире за последние полгода подорожала почти на 40%. В РФ эта тенденция тоже видна.

Какая реальная экономика, а не только железо

Дальше идёт самая болевая часть, которую любят забывать в калькуляторах "сколько стоит свой ChatGPT".

На Хабре есть качественный экономический разбор от автора с никнеймом Xronofag, CPO в финтехе. Он считает на международных ценах, но пропорции работают и в РФ. Главный вывод: на горизонте года при объёме около 100 миллионов токенов в месяц self-host модели 14B стоит около 25-30 миллионов рублей, модели 70B - около 40-50 миллионов. При этом железо в этих числах занимает всего 15% бюджета. Остальное - люди.

Что в РФ значит "люди" для self-hosted LLM:

ML-инженер, который занимается развёртыванием, квантизацией, тюнингом. Сильный спец в Москве сейчас стоит 350-600 тысяч в месяц, плюс налоги. Если делать инхаус - это полное рабочее место. Если на аутсорсе - 150-300 тысяч за проект внедрения плюс ежемесячная поддержка.

DevOps, который следит за самим сервером, обновлениями, мониторингом, безопасностью. 250-400 тысяч в месяц инхаус, или часть нагрузки на действующего админа.

Обновления моделей. Каждые 3-6 месяцев выходит новая версия Qwen, Saiga, Mistral. Тестировать, перекатывать, проверять на регрессах. Это либо тот же ML-инженер тратит 15-30% времени, либо аутсорс с подписочной моделью.

Электричество. Сервер с H100 в режиме нагрузки потребляет около 700 Вт. В месяц это 500-600 кВтч, по корпоративному тарифу 5-7 тысяч рублей. На двух серверах удваивайте. Не катастрофа, но в TCO забыть про это нельзя.

Простой и поломки. GPU выходят из строя. Сервер падает. В прошлом году у одного клиента H100 ушла в ремонт на три недели, бизнес откатился на YandexGPT API. Если у вас не куплено резервирование, аварийный план должен быть.

Итого по железу уровня 2 (H100, средний прод) полная стоимость владения за первый год: 2.5-4 миллиона на железо, 1.5-3.5 миллиона на людей и обновления (в зависимости от того, инхаус или аутсорс), 60-100 тысяч на электричество и стойку. Округляя - 4-7 миллионов за первый год, дальше около 2-4 миллионов в год на поддержку.

Сценарий 1: маркетинговое агентство на 20 человек

Реальный кейс. Клиент пишет: "Хотим свой ChatGPT для редакции, чтобы не зависеть от OpenAI и платить меньше". Объём - примерно 50 запросов в день у всей команды, средний промпт на тысячу токенов, среднее тело ответа на полторы тысячи.

Считаем расход на API: 50 запросов x 2500 токенов x 20 рабочих дней = 2.5 миллиона токенов в месяц. По прайсу YandexGPT Pro или GigaChat Pro - около 1.5-3 тысяч рублей в месяц. По OpenAI GPT-4o через посредника - 8-15 тысяч в месяц. По Anthropic через посредника - 12-20 тысяч.

Считаем self-hosted: минимальный сервер 350 тысяч единоразово, плюс минимум полставки админа (или аутсорс 30-50 тысяч в месяц на поддержку). За год это 700-900 тысяч. Против 30 тысяч на API.

Вывод: для команды в 20 человек на типовых задачах генерации текста self-hosted сжигает деньги. Окупаемость никакая. Платите за API и не выдумывайте. Это и есть тот случай, про который пишет Xronofag: "Self-host ради экономии на токенах в 2026 году - плохой кейс почти для всех".

Здесь работает другой сценарий: RAG-система поверх ваших документов с API в качестве движка. Никакого своего железа, данные не уходят в облако в чистом виде (только эмбеддинги и обезличенные фрагменты), бюджет внедрения 150-300 тысяч единоразово. Это покрывает 80% реальных потребностей таких команд.

Сценарий 2: юридическая фирма на 60 человек

Уже интереснее. Юристы работают с договорами, перепиской по делам, выписками из ЕГРЮЛ, иногда с банковскими тайнами и подобной чувствительной фактурой. Часть этого юридически нельзя отправлять во внешние API без согласия клиентов, а согласие на "передачу персональных данных в иностранный сервис" клиент не подпишет никогда.

Объём: каждый юрист несколько раз в день генерирует или анализирует тексты. 60 человек x 15 запросов x 3000 токенов = 2.7 миллиона токенов в день, 60 миллионов в месяц.

API в РФ потянет: YandexGPT Pro в большом тарифе - 30-50 тысяч в месяц. Только тут проблема не в цене, а в том, что отправлять полные тексты договоров и переписки во внешний сервис - это нарушение договорённостей с клиентами. Договор с Яндекс Облаком по 152-ФЗ это частично закрывает, но многие крупные клиенты юрфирм требуют, чтобы их данные "не покидали инфраструктуру исполнителя". Точка.

Self-hosted сетап: один сервер на H100 80 ГБ за 3 миллиона, плюс аутсорс ML/DevOps на 80-120 тысяч в месяц, плюс электричество и стойка. Первый год около 5 миллионов, потом 1.5-2 миллиона в год. На сервере крутится Qwen 3 30B с дообученным под юрлексику адаптером, плюс RAG поверх базы шаблонов договоров и судебной практики.

Окупаемость: 60 юристов, экономия на каждом юристе условно час в день на черновых задачах (составление черновика договора, поиск похожего прецедента, краткая выжимка из 80-страничного документа). Час в день - это 20 часов в месяц. По ставке младшего юриста 2.5 тысячи в час - 50 тысяч в месяц на одного. На 60 человек теоретический потолок 3 миллиона в месяц. Реалистично - 30-40% от этого, то есть около миллиона.

Сервер окупается за 5-7 месяцев. И ещё закрывается требование клиентов по приватности, что само по себе становится конкурентным преимуществом фирмы. Подробнее про дообучение моделей под лексику есть в отдельном разборе.

Сценарий 3: страховая компания на 350 человек

Здесь экономика начинает играть совсем по-другому. Страховщики обрабатывают огромные потоки документов: заявления, медзаключения, акты, фото повреждений, переписку с клиентами. ИИ может закрывать ускорение классификации, первичный анализ, генерацию ответов.

Объём токенов в такой компании - сотни миллионов в месяц легко. На API это миллионы рублей в месяц в любом раскладе. А зарубежные API запрещены де-факто по тем же причинам, что у юристов: персональные данные клиентов, медицинские данные, финансовая информация.

Self-hosted сетап: два сервера H100 или один с двумя H200, кластер с балансировкой, vLLM с продакшен-настройками. 8-12 миллионов на железо, инхаус-команда из ML-инженера и DevOps (либо плотный аутсорс на 200-300 тысяч в месяц). Первый год около 15-20 миллионов, потом 5-8 миллионов в год.

Окупаемость: даже на 5% ускорении обработки одного убытка экономия становится осязаемой. Если страховщик обрабатывает 5000 убытков в месяц, и на каждом экономит 15 минут эксперта по 1500 рублей в час - это 1.8 миллиона в месяц только на этой задаче. Плюс автогенерация ответов клиентам, плюс ассистент для андеррайтеров, плюс ускорение саппорта.

На vc.ru есть кейс компании w3h, которая описала переход enterprise-продукта обработки документов с облачных API на собственные дообученные модели. Стоимость обработки одного документа упала в 40 раз. Цифры специфичны для их объёмов, но порядок понятен: при больших объёмах self-host экономит реально, а не на бумаге.

Self-hosted под страховую окупается за 8-14 месяцев. Дальше работает только на плюс.

Сценарий 4: банк средней руки

Финал в этой галерее. У банков накладывается ещё один слой: регуляторика ЦБ, ФСТЭК, требования по сертифицированным средствам защиты, аттестация ИСПДн, отдельные требования к коммерческой тайне и банковской тайне. Отправка персональных данных клиентов в любое внешнее облако (даже российское) согласовывается с информационной безопасностью полтора года, и обычно её просто не разрешают.

На Хабре есть подробный разбор связки LLM и 152-ФЗ: основной вывод там - самый надёжный путь это локальное развёртывание, всё остальное это компромиссы с дополнительными слоями анонимизации, токен-подмены, договорами с провайдером по поручению на обработку.

Сценарии использования: внутренний ассистент для сотрудников по корпоративной базе знаний, ускорение анализа кредитных заявок, фрод-анализ переписки и заявок, генерация черновиков клиентских писем, помощь комплаенс-офицерам.

Сетап: кластер 4-8 H100/H200, инхаус-команда из 3-5 человек, отдельные требования к мониторингу, аудит-трейлу, инфобезу. Бюджет внедрения 30-80 миллионов рублей в зависимости от размера банка и амбиций. Поддержка - 10-20 миллионов в год.

Окупаемость в таких масштабах считается не на горизонте года, а на горизонте 2-3 лет. Но альтернатив у банков по сути и нет: облачные API закрыты регуляторкой, а отказ от LLM-инструментов уже даёт конкурентам слишком большое преимущество.

Когда локальная LLM окупается, и когда нет

Сворачиваю четыре сценария в простую матрицу.

Локальная LLM почти точно НЕ окупается, если:

У вас меньше 30-50 регулярных пользователей. Расход на API будет меньше, чем зарплата одного ML-инженера. Точка.

Задачи у вас типовые: генерация маркетинговых текстов, базовый саппорт, классификация писем. Это закрывается на 90% API российских вендоров или гибридом с анонимизацией.

У вас ограничен бюджет. Self-hosted это не разовая трата, а постоянная статья расходов с длинным хвостом обслуживания.

У вас нет отдельных людей под это направление и нет планов нанимать или аутсорсить. Сервер с GPU без живого обслуживания превращается в кирпич за полгода.

Локальная LLM окупается, если:

У вас больше 50 активных пользователей, и нагрузка предсказуема. Здесь TCO на self-host начинает выигрывать у API за горизонт 12-18 месяцев.

Вы работаете с чувствительными данными: персональные, медицинские, банковская тайна, коммерческая тайна, защищаемая клиентами. Юридический риск отправки в облако сам по себе делает self-host оправданным.

У вас регулируемая отрасль: банки, страховые, медицина, гособоронзаказ, оборонка. Регуляторика часто закрывает облачные опции до того, как вы начнёте считать экономику.

У вас специфическая лексика: юридическая, медицинская, инженерная, отраслевые жаргоны. Дообученная под себя модель работает кратно лучше общих API, и это даёт измеримое преимущество.

У вас стратегическое требование по независимости от внешних вендоров. Санкционные риски, геополитика, "если завтра OpenAI закроет доступ к API". У части клиентов это решающий фактор.

Подробнее про внедрение локальных LLM на своём сервере и про дообучение моделей под ваши данные у меня есть отдельные продуктовые страницы с прайсом.

Гибридная схема: средний путь

В 2026 году у части клиентов оптимальный сценарий - не "только self-host" и не "только API", а гибрид.

Идея такая. Маленькая локальная модель уровня 7-14 миллиардов параметров стоит на скромном сервере с одной RTX 4090 или арендованной A100. Её задача - обработка персональных данных, анонимизация, замена ФИО и номеров договоров на токены. После этого обезличенный запрос уходит в большую модель: либо в API российского вендора, либо в зарубежную модель через посредника.

На Хабре у Just AI есть детальный разбор такой схемы для российского бизнеса с точки зрения 152-ФЗ. Архитектурно она проще полноценного self-host (одна маленькая модель против инфраструктуры под большую), юридически закрывает основные риски, экономически дешевле.

Бюджет такой гибридной схемы: 400-800 тысяч на старт (сервер плюс внедрение слоя анонимизации плюс обвязка), 50-80 тысяч в месяц на поддержку плюс трафик API. Это вписывается в бюджет компаний от 30 человек и закрывает 70-80% сценариев, где иначе пришлось бы строить полноценный self-host.

Подводные камни, про которые молчат продавцы железа

Несколько вещей, которые любят опускать в коммерческих предложениях.

Производительность сильно зависит от стека. По бенчмаркам Red Hat за 2026 год, vLLM на той же железке выдаёт около 793 токенов в секунду против 41 у Ollama при 8 одновременных пользователях. Это 19-кратная разница. Если интегратор разворачивает вам Ollama "потому что проще", через месяц вы упрётесь в потолок. Подробнее это разбирается в материалах AIBot.Direct по локальной LLM на сервере в 2026.

Квантизация ломает качество. Чтобы модель влезла в одну GPU, её "квантуют" - сжимают веса с 16 до 8, 4 или даже 3 бит. На простых задачах это не видно. На сложных, особенно на русском с длинным контекстом, качество просаживается заметно. Если подрядчик показывает демо на простых вопросах - попросите тесты на ваших реальных кейсах.

Контекстное окно стоит памяти. Чем длиннее контекст, тем больше VRAM. На H100 80 ГБ комфортно держать Qwen 3 30B с контекстом 16-32 тысячи токенов. Хотите 128 тысяч - либо две GPU, либо квантизация, либо ждите. Это не теоретическая проблема: реальные задачи юристов и аналитиков часто требуют именно длинного контекста.

Цены на GPU растут. H100 за полгода подорожал в аренде на 40%. На покупку - в районе плюс 15-25% в зависимости от поставщика. Прогноз - расти продолжит до конца 2026 минимум.

Обновления моделей - постоянная работа. Когда выходит новая Qwen или новая Saiga, надо тестировать, валидировать, перекатывать. Это не "поставил и забыл". В смету закладывается 15-25% времени ML-инженера на поддержку моделей.

Что в итоге

Локальная LLM на своём сервере в 2026 году - это не модный аксессуар и не "очевидно правильное решение". Это инструмент с конкретной экономикой, которая хорошо считается на бумаге за час.

Считайте честно. Запросов в день, токенов на запрос, людей, которые будут это поддерживать, регуляторных требований. Если по всем четырём критериям получается, что self-host оправдан - идите в него уверенно, окупится. Если хотя бы по двум проседаете - оставайтесь на API или гибриде.

Большая часть SMB в РФ, по моему опыту, на API. И это нормально. Они не должны тратить миллионы на собственный ML-стек, чтобы автоматизировать саппорт и генерацию контента. Self-host - инструмент для тех, кому он действительно нужен по делу, а не для красоты.

Хайп вокруг "своих ИИ" перегрет. Реальная экономика гораздо суше и спокойнее, чем картинка в соцсетях про "построил GPT за неделю". Это нормально. Технология взрослеет.

Близкие темы

Локальные LLM на своём сервере - продуктовая страница с моим прайсом по внедрению. Fine-tune LLM на ваших данных - дообучение моделей под отраслевую лексику. RAG-системы под ключ - альтернатива и дополнение к локальным моделям для работы с базами знаний. YandexGPT vs GigaChat для бизнеса - сравнение российских API, которые часто закрывают задачи без self-host. RAG vs Fine-tune - как выбрать между двумя подходами обучения ИИ на ваших данных.

Источники

  1. Хабр - Compute crunch пришёл: как считать экономику LLM в 2026 (Xronofag, CPO в финтехе)
  2. vc.ru - Как мы сократили расходы на LLM в 40 раз и отказались от облачных моделей (w3h)
  3. Хабр, Selectel - Практическое руководство по Qwen: установка, настройка vLLM и работа через API
  4. AIBot.Direct - Локальная LLM на сервере в 2026: модели, железо, стек и бюджеты
  5. Хабр - LLM, персональные данные и 152-ФЗ
  6. Хабр, Just AI - Секреты LLM по API: динамическая анонимизация данных для российского бизнеса
  7. Selectel - аренда выделенных серверов с GPU, актуальные тарифы
  8. Rutab - аренда NVIDIA H100 подорожала почти на 40% за полгода (по данным SemiAnalysis)
  9. Хабр - 152-ФЗ и LLM несовместимы по умолчанию: как мы это исправили без потери качества
  10. Хабр, Alpina Digital - Безопасное внедрение ИИ в корпорации: 3 архитектурных подхода

Считаете локальную LLM для своей компании?

Опишите задачу: сколько пользователей, какие данные, какие сценарии. Верну расчёт TCO с железом и поддержкой за 24 часа. Без обязательств.

Обсудить задачу