Зимой 2025 один клиент-юрист написал в чате: "Я после трёх созвонов в день выпотрошен. Пишу за всеми протоколы вручную, потому что доверять нейросетке боюсь, она в прошлый раз перепутала истца с ответчиком". Я тогда ему ничего конкретного не посоветовал. Полез разбираться сам.
За полгода через мои руки прошло штук пятнадцать сервисов расшифровки. Часть отвалилась сразу - кто-то не понимал, что такое "выписка из ЕГРЮЛ", кто-то спикеров путал так, что протокол читался как монолог одного человека. Четыре сервиса я тестировал серьёзно, на одних и тех же записях, в трёх разных акустиках. Это про них.
Как я выбирал сервисы для теста
На рынке СНГ сейчас условно три эшелона. Первый - API-движки распознавания речи. Это Yandex SpeechKit, SaluteSpeech от Сбера, T-Bank VoiceKit (раньше Tinkoff), Whisper от OpenAI. На них работает почти всё остальное. Цена за минуту - копейки, но нужен разработчик, чтобы это завернуть в интерфейс.
Второй эшелон - готовые сервисы со своим UI, которые внутри либо крутят чужой движок, либо свой собственный. Сюда входят русские mymeet.ai, MeetScribe, Voicee, Teamlogs, Писец, Speech2Text. Из международных - Otter, Read.ai, Tactiq, tl;dv, MeetGeek, Fireflies. Они дают всё в одном: запись, расшифровка, суммаризация, диаризация, экспорт в Notion или Google Docs.
Третий эшелон - речевая аналитика. Тут не просто "превратить звук в текст", а ещё проанализировать, что менеджер сказал, по каким техникам продаж работал, отработал ли возражения. Это Rechka.AI, Voicee Analytics, Speech Analytics, МТС Exolve, Calltouch AI. Для целей этой статьи третий эшелон оставляю в стороне, он про другое.
Для теста взял четыре сервиса, которые покрывают типовые сценарии у клиентов: mymeet.ai (российский, заточен под русский), Read.ai (международный, работает с RU), SaluteSpeech через готовую обвязку (как пример "поверх API") и Whisper large-v3 локально (как бенчмарк качества без оглядки на удобство). Прогнал три разных записи: продажный звонок по телефону, юридическую консультацию в Zoom втроём и часовой созвон по проекту в Google Meet, где четыре человека постоянно перебивают друг друга.
Эталонные API. Сколько на самом деле стоит минута русского
Прежде чем сравнивать готовые сервисы, нужно понять, во сколько обходится сам движок. Это потолок маржи у любого, кто продаёт расшифровку поверх чужого API.
Yandex SpeechKit. Асинхронное распознавание - 1 копейка за секунду двухканального аудио. Это 60 копеек за минуту или 36 рублей за час. Минимальная единица тарификации 15 секунд. По данным Хабра, у Yandex SpeechKit на сравнительных тестах русской речи самая высокая ошибка из всех российских API (WER 0.5496), но это специфика бенчмарков с шумной телефонией. На чистом Zoom-звуке разница меньше. Главный плюс - стабильность инфраструктуры и работа без VPN из РФ.
SaluteSpeech от Сбера. В постоплате - 1 копейка за секунду, как и Яндекс. В пакете 20 000 минут за 12 000 рублей - 60 копеек за минуту. То есть час расшифровки стоит те же 36 рублей. Минимальный платёж в постоплате 15 тысяч в месяц, что отсекает совсем мелких пользователей. На том же бенчмарке Хабра показал WER 0.4481, заметно лучше Яндекса. По моим ощущениям на медицинской и юридической лексике Сбер действительно держит формулировки точнее. На странице тарифов SaluteSpeech ещё есть пакет распознавания на 100 минут в месяц бесплатно для физлиц, удобно потестировать.
T-Bank VoiceKit. Если верить старым публикациям, корпоративная цена была 40-45 копеек за минуту двухканального аудио. Это самый дешёвый российский вариант. Точных свежих тарифов 2026 года в открытом доступе нет, цены отдают по запросу. На моих звонках качество распознавания было хорошим именно на телефонии - VoiceKit изначально пилился внутри Тинькова на колл-центр банка, у них там телефонный шум как родной.
Whisper от OpenAI. По API стоит около 50 копеек за минуту в пересчёте по официальному курсу. Через российские шлюзы вроде AITUNNEL платят рублями, наценка процентов 30-40. Локально на своём железе - бесплатно по тарификации, но нужна видеокарта с 10+ ГБ VRAM для large-v3, иначе будет работать невыносимо долго. На моих тестах Whisper стабильно даёт лучшую точность по словам, но проседает на диаризации - из коробки её нет, нужно навешивать отдельные модели вроде pyannote.
Этот ценовой расклад нужно держать в голове, когда смотришь на готовые сервисы. Если кто-то продаёт расшифровку русского часа за 200 рублей с встроенной суммаризацией - окей, это маржа на удобство. Если за 800 - вопросы.
Тест №1: Mymeet.ai. Самый удобный из русских
Mymeet.ai сейчас - один из самых заметных русских сервисов на рынке. Сидит на собственной (и частично российской облачной) инфраструктуре, поддерживает 50+ языков, но реально оптимизирован под русский. По тарифной сетке бесплатный план даёт 180 минут в месяц, дальше платные планы от 850 рублей в месяц на пользователя.
Подключил к Google Meet через расширение и к Zoom через бота-участника. Это удобно - не надо заранее ничего качать, прилетел бот, послушал, отдал результат через минут пять после окончания встречи.
Качество на чистом Zoom. Часовой созвон по проекту, четыре человека, нормальные гарнитуры. Распознавание - на четвёрку с плюсом. Из часа речи я нашёл штук десять ошибок в специфических терминах ("щибдеф" вместо "QA-дев", "промт" в одном месте превратился в "промт-инжиниринг" а в другом в "промет"). Диаризация спикеров на удивление приличная: четырёх людей развёл по голосам почти без ошибок, перепутал только в одном моменте, когда двое заговорили одновременно.
Качество на телефонии. Это уже хуже. 15-минутный звонок с клиентом через Manyzon (записан в формате моно, низкий битрейт) - точность упала, я насчитал штук 35 ошибок. Диаризация развалилась, потому что в моно один канал, а Mymeet не умеет вытаскивать спикеров чисто по голосу, ему нужна разметка каналов.
Суммаризация и протокол. Тут Mymeet хорош. В 11 форматов умеет: классический протокол с участниками и решениями, краткое саммари в три абзаца, список задач с ответственными, выжимка возражений (для продаж), таймкоды. На юридической консультации правильно вычленил три ключевых вопроса и предложенные ответы. На проектном созвоне выдал список из 12 задач, из них реально к делу относились 9 - три были "обсудим в чате потом", их сервис принял за задачу.
Экспорт. В Notion через интеграцию летит чисто, с заголовками и спикерами. В Google Docs тоже. Из минусов - нет нативной интеграции с Bitrix24 и amoCRM, ставится через Zapier-аналог. Не катастрофа, но требует возни.
Цена в моём сценарии. На семь сотрудников, у которых по 3-5 созвонов в неделю, тариф Pro на годовой подписке выходил около 18-22 тысяч рублей в месяц на всех. Это примерно 1.5-2 рубля за минуту расшифровки. Дороговато по сравнению с API, но за удобство и протоколы платишь не за минуту, а за сэкономленный час руками.
Тест №2: Read.ai. Международный с амбициями
Read.ai - один из самых раскрученных международных сервисов. Любят его за визуальную аналитику: процент участия каждого, "вовлечённость", "тональность". В 2025 они добавили нормальную поддержку русского, что для меня было поводом проверить серьёзно.
Цена. Тариф Pro - примерно 2200-2500 рублей в месяц через российскую карту с комиссией посредника. Оплата только зарубежная, российские карты не принимаются напрямую, нужна посредническая схема. Для российского ИП это сразу минус.
Качество распознавания на русском. Чистый Zoom-созвон, четыре человека - точность на уровне Mymeet, может быть на полпроцента хуже. На том же часе я нашёл штук 18 серьёзных ошибок. На английских вставках Read.ai лучше, но в смешанной речи иногда срывается в латиницу, пишет русские слова английскими буквами, что выглядит странно.
Диаризация. Хорошая, на уровне Mymeet. Но имена спикеров определяет хуже - использует данные из календаря, и если на встрече Сергей подключился с устройства жены, в протоколе он будет "Елена". На английском Read.ai пытается само выудить имя из представлений в начале встречи, на русском эта фишка работает нестабильно.
Аналитика. Вот тут Read.ai реально интересен. Показывает, кто сколько говорил, какая была "энергия" встречи, где были моменты молчания и где спор. На совещаниях, где один человек давит и не даёт другим говорить, это видно сразу. Полезно для тимлида, который хочет улучшать культуру встреч. На продажных звонках цифры по вовлечённости менеджера и клиента дают понять, кто кого ведёт.
Протокол. Сам по себе сводный отчёт хороший, аккуратные пункты. Но именно по-русски структура иногда расползается: суммаризация на английском с русскими цитатами выглядит как франкенштейн. Можно переключить язык вывода, но тогда теряется часть нюансов.
Экспорт. С Notion дружит чисто, с Google Docs тоже. Интеграции с российскими таск-трекерами нет, всё через Zapier и его аналоги.
Вывод по Read.ai. Хорош для команд, где много английского и где руководителю важна аналитика встреч. Для русскоязычной фирмы, которая просто хочет нормальные протоколы, переплачивать за это и возиться с оплатой - смысла мало. Подробнее про то, как сейчас обстоят дела со STT в русском бизнесе, я отдельно разбирал.
Тест №3: SaluteSpeech в обвязке. Когда выгодно копать в API
Третий вариант я собрал нестандартно. Взял SaluteSpeech как движок распознавания и накатил на него простой n8n-сценарий: входит файл из Google Drive, идёт в API Сбера, выходит распознанный текст с диаризацией, через GigaChat генерируется протокол в нужном формате, всё отправляется в Notion.
Это не "готовый продукт", это вариант для тех, у кого есть человек, который умеет в n8n. Имеет смысл, если у вас в неделю проходит 30-50 часов аудио и платить по тарифам Mymeet становится накладно.
Качество распознавания. На моих тестах SaluteSpeech дал лучший результат среди трёх "коммерческих" вариантов. На чистом Zoom-аудио точность была сопоставима с Whisper, иногда даже выше на специфической лексике (медицина, юриспруденция, госзакупки - тут Сбер чувствует домен). Терминологию русского бизнеса слышит уверенно: "ЕГРЮЛ", "ИП", "субсидиарная ответственность", "акт сверки" - всё на месте.
Диаризация. SaluteSpeech умеет в диаризацию по каналам и по голосам. По голосам работает прилично, но не идеально - в моих созвонах вчетвером периодически склеивал двух спикеров с похожим тембром в одного. По каналам (когда звонок записан стерео с разделением) работает безупречно.
Стоимость в обвязке. 36 рублей за час расшифровки плюс копейки на токены GigaChat на саммари. На 100 часов в месяц это 3600 рублей за движок, плюс пару тысяч за GigaChat, итого 6 тысяч. Mymeet на тех же объёмах стоил бы в три раза больше. Но это без учёта работы того, кто это всё собрал и поддерживает. Если оценить работу подрядчика, разовый запуск такой обвязки выходит 60-120 тысяч рублей, плюс мейнтенанс 5-15 тысяч в месяц.
Кому подходит. Компании с уже работающим n8n или Make, где есть культура автоматизации. Колл-центрам с большим потоком звонков. Юридическим фирмам, где много специфической терминологии и важна максимальная точность. Я этот сценарий обычно предлагаю как часть голосового ИИ или отдельной услуги по расшифровке, когда у клиента уже есть стек автоматизации.
Что не понравилось. Минимальный платёж SaluteSpeech в постоплате - 15 тысяч в месяц. Если у вас в декабре прошло 5 часов аудио, заплатить вы всё равно должны минимум. Эта особенность отсекает мелкие проекты, для которых имеет смысл взять пакетный тариф или вообще пойти в готовый сервис.
Тест №4: Whisper локально. Бенчмарк для маньяков
Четвёртый вариант я тестировал не как реальное решение для большинства клиентов, а как точку отсчёта. Whisper large-v3 на собственном железе с диаризацией через pyannote - это золотой стандарт качества в опенсорсе сейчас.
Точность. Самая высокая из всех тестов. На чистом Zoom-аудио я нашёл всего 4-6 ошибок на час речи. Терминологию ловит хорошо, пунктуацию расставляет приличную, заглавные буквы у имён собственных тоже. Из минусов: иногда галлюцинирует на тишине, может вставить целую фразу "продолжение следует, оставайтесь с нами" в конец трека, где была тишина. Это известный баг large-v3, на v3-turbo полегче.
Диаризация. Через pyannote получается чуть лучше, чем у Mymeet и Read.ai, но возни заметно больше. И там, и там система требует выровнять таймкоды Whisper и pyannote, что без скриптов руками не сделаешь.
Стоимость. Если у вас уже есть сервер с видеокартой - себестоимость минут стремится к нулю. Если арендовать видеокарту в Selectel или Yandex Cloud - примерно 50-80 рублей в час на расшифровку часа аудио. Сравнимо с готовыми сервисами по стоимости, но требует команды или подрядчика на поддержку. Подробно про то, кому стоит крутить локальные LLM и аудио-модели на своём железе, у меня есть отдельный материал.
Кому подходит. Компаниям, где данные строго не должны уходить наружу. Юристам, врачам, тем, кто работает с гостайной или коммерчески критичной информацией. Госсектору, у которого требования по 152-ФЗ. Для них Whisper на своей машине - единственный вариант, потому что в любом облачном сервисе аудио улетает на чужие серверы.
Что плохо. Без программиста это не работает. Whisper сам по себе - это командная строка и скрипты. Хочешь интерфейс - пиши. Хочешь интеграцию с Notion - пиши. Хочешь, чтобы бот сам подключился к Zoom и записал - извини, такого "из коробки" нет. Это движок, а не продукт.
Сводная таблица в голове. Кто чего стоит
Если суммировать ощущения по трём аудио-сценариям и четырём сервисам:
Точность распознавания русского (от лучшего к худшему): Whisper large-v3 - SaluteSpeech - Mymeet - Read.ai - Yandex SpeechKit. Разница между топ-3 невелика, между топ-3 и Read.ai заметна, между всеми и Яндексом ощутима именно на телефонии.
Диаризация (разделение спикеров): SaluteSpeech по каналам - Whisper+pyannote - Mymeet - Read.ai - SaluteSpeech по голосам. На стереозаписи побеждает Сбер за счёт нативной разметки каналов. На моно-звуке (телефония, один микрофон в переговорке) лучше работают связки на pyannote.
Качество протокола и саммари: Mymeet - SaluteSpeech+GigaChat - Read.ai - Whisper (его само по себе нет, нужно навешивать LLM сверху). Mymeet тут впереди за счёт 11 готовых шаблонов протоколов, которые реально подобраны под русский деловой контекст.
Удобство интеграций: Mymeet - Read.ai - SaluteSpeech-обвязка - Whisper. Готовые сервисы быстрее запустить, обвязки требуют времени.
Цена за час расшифровки: Whisper локально (10-80 рублей) - SaluteSpeech API (36 рублей) - Yandex SpeechKit (36 рублей) - Mymeet (90-200 рублей в зависимости от тарифа) - Read.ai (~150-200 рублей в пересчёте на час).
Главный вывод: между "почти лучшее качество за маленькие деньги" и "лучшее качество с удобным UI за нормальные деньги" - разница процентов в 10-15. Многим важнее удобство, и Mymeet выигрывает. Тем, кто упирается в объём или специфичную точность, есть смысл идти в обвязку поверх API.
Четыре сценария из реальной жизни. Что я обычно советую
Продажник в B2B. Делает 5-15 звонков в день, 60-70% по телефону, остальное по Zoom или Telemost. Главное - суммаризация возражений и контекст для следующего звонка. Тут Mymeet берёт уверенно. 4 часа звонков в день, 80 часов в месяц - это тариф Pro плюс докуп минут, выходит 4-5 тысяч в месяц. Окупается за неделю, если продажник перестал терять контекст и забывать обещанные действия. Если звонков больше 200 в месяц - имеет смысл смотреть в сторону речевой аналитики поверх собственной обвязки. Это уже отдельная тема, ближе к контролю качества звонков.
Юрист на консультациях. Часовые встречи с клиентом, 2-3 в день, обязательная фиксация всего, что обсуждалось. Здесь критично два: точность терминологии и приватность. Точность - в пользу SaluteSpeech или Whisper. Приватность - в пользу Whisper локально. Стоит порекомендовать комплект на своём сервере, плюс простой веб-интерфейс на 1-2 пользователей. Стоимость запуска - 150-250 тысяч, ежемесячно 5-10 тысяч за хостинг. По объёмам 60 часов аудио в месяц это окупается за квартал на одной сэкономленной паралегали. Адвокат на 25 человек в моём контуре сделал такое - доволен. Подробнее про ИИ для юристов разбирал в отдельном материале.
Проджект-менеджер на агентстве. 8-12 созвонов в неделю, по 60-90 минут, четыре-шесть участников, постоянные перебивания. Главное - протокол с задачами и таймкодами. Берёт Mymeet, выгружает в Notion, проверяет руками за 5-10 минут. Раньше тратил по 30-45 минут на каждый созвон, чтобы написать протокол. На 10 созвонах в неделю - это 4-7 часов в неделю экономии. На годовом тарифе Mymeet 850 рублей в месяц с пользователя - такая экономия окупается мгновенно. Я в своих проектах сейчас работаю похожим образом, разбирал детальнее в материале про ИИ-ассистента руководителя.
Основатель ИТ-компании на 60 человек. Гибридный режим: онлайн-планёрки, очные совещания, звонки с клиентами, питчи инвесторам. Объём - 40-60 часов аудио в месяц. Хочет, чтобы все встречи раскладывались в единую базу знаний. Здесь интересен сценарий "Mymeet для рутины + обвязка SaluteSpeech для внутренних созвонов + Whisper локально для самого чувствительного". Каждый инструмент в своём слое. Бюджет 30-50 тысяч в месяц на всё, плюс 200-300 тысяч на старте на интеграции и сборку базы знаний. Окупается за полгода, если рассматривать это как часть RAG-системы по корпоративным знаниям.
Где сейчас все ошибаются
Ошибка первая: выбирают по точности, забывая про сценарий. Whisper всех бьёт по проценту правильно распознанных слов, но в проде, где встреча идёт онлайн через Zoom, и через две минуты после окончания вам нужен протокол в Notion, побеждает Mymeet. Точность ради точности не нужна, если она требует часа возни после каждого созвона.
Ошибка вторая: гонятся за функциями, которых не используют. Read.ai продаёт аналитику тональности и вовлечённости. Звучит круто. По факту 90% пользователей открывают её раз в месяц, удивляются, и больше не открывают. За эту неиспользуемую аналитику платят 2-2.5 тысячи в месяц на пользователя. Мне ещё ни один клиент не сказал, что эта фишка для него полезнее, чем нормальное саммари.
Ошибка третья: думают, что бесплатные минуты решат вопрос. У всех есть фримиум - 100-200 минут в месяц. Это значит максимум 3-4 встречи. Если вы реально хотите расшифровывать систематически, в первый же месяц вы упрётесь в потолок. Считайте сразу платную подписку, не обманывайтесь.
Ошибка четвёртая: ставят сервис, не объяснив коллегам. Видел кейс: руководитель внедрил Mymeet, бот начал ходить на все Zoom. Подчинённые узнали об этом задним числом, обиделись. Полгода пользователи саботировали - выходили из звонков, отключали запись. В РФ к "тайным записям" отношение нервное, особенно если в созвоне есть внешние клиенты. Всегда сначала договоритесь с командой и предупреждайте контрагентов. По закону, кстати, без согласия записывать собеседника нельзя.
Ошибка пятая: ждут чуда от расшифровки звонков с трубки. Если у вас не настроен запись звонков через корпоративную телефонию, и менеджер записывает на диктофон в смартфоне, лежащем на столе - никакой Whisper это нормально не распознает. Низкий битрейт, шум, эхо. На таком исходнике точность падает до 60-70% даже у топовых сервисов. Сначала наведите порядок с записью, потом расшифровывайте.
Сколько на самом деле тратят. Цифры из практики
На небольшой команде 5-7 человек, у которых по 4-6 созвонов в неделю каждый, разумный бюджет на расшифровку - 6-15 тысяч рублей в месяц. Это покрывается готовым сервисом вроде Mymeet на тарифе Pro или Premium. Внедрение - один день, обучение - час на человека.
На средней команде 20-40 человек с разными ролями (часть на продажах, часть на проектах, часть на консультациях) разумный бюджет 25-50 тысяч в месяц. Тут уже имеет смысл миксовать: основной массе Mymeet или аналогичный готовый сервис, продажникам с большим потоком - речевая аналитика поверх SaluteSpeech, юристам с приватными звонками - локальный Whisper. Внедрение - 2-4 недели, разовые затраты 80-200 тысяч на интеграции и обучение.
На крупной компании 100+ человек, особенно с регулятивными требованиями (банки, медицина, госструктуры) - расшифровка превращается в инфраструктурный проект. Свой инстанс Whisper на своих серверах, обвязка через n8n или собственные скрипты, интеграция с корпоративной телефонией, CRM, базой знаний. Бюджет на старте 500 тысяч и выше, ежемесячно 30-80 тысяч на поддержку. Окупается за 8-14 месяцев, обычно с лихвой.
На фоне всего этого - кейс из публичного обзора на Хабре про автоматизацию контроля качества звонков. Там команда заменила супервайзеров, которые слушали выборку звонков, на полную автоматическую расшифровку и анализ. Точность срабатывания моделей по выявлению нарушений - 92-94%. Высвободили 4 ставки супервайзеров, экономия в год - около 5 миллионов рублей при затратах на запуск 1.2 миллиона.
Что в итоге
Магия расшифровки сейчас не в точности движка. Она в том, чтобы свести расшифровку, суммаризацию, диаризацию и выгрузку в нужное место в одну рабочую цепочку. Точность отдельных моделей выровнялась - между топовыми вариантами разница в проценты. Выигрывает тот сервис, который дешевле и быстрее интегрируется в ежедневный рабочий процесс.
Для большинства небольших и средних команд это сейчас Mymeet или аналоги. Для тех, кому критична приватность - локальный Whisper. Для тех, у кого большой поток и есть команда автоматизации - обвязка поверх SaluteSpeech или связки на pyannote. Read.ai и другие международные сервисы - вариант для смешанных русско-английских команд, готовых платить за визуальную аналитику.
Главное - не лезть в этот рынок с мыслью "сейчас Whisper включим и заживём". Whisper сам по себе вам ничего не даст. Расшифровка - это не команда консоли, это процесс. С записью, согласием участников, форматом протокола, экспортом в нужный таск-трекер, проверкой ошибок. Если эту цепочку не построить, любой сервис будет восприниматься как "не работает".
Близкие темы
AI-расшифровка встреч под ключ - продуктовая страница с моим прайсом на запуск под клиента. AI-ассистент руководителя - смежная тема, где расшифровка встреч это один из модулей. STT в русском бизнесе 2026 - расширенный разбор движков распознавания речи. TTS для бизнеса 2026 - обратная задача, синтез речи. Голосовые ИИ-агенты в бизнесе - что делают со звуком после расшифровки. ИИ-инструменты для малого бизнеса - общий обзор того, что реально работает у клиентов.
Источники
- Yandex Cloud - официальные тарифы Yandex SpeechKit на распознавание речи
- Sber Developers - тарифы SaluteSpeech для юрлиц (пакет 20 000 минут за 12 000 рублей и постоплата 1 коп/сек)
- T-Bank Software - тарифы VoiceKit (бывший Tinkoff VoiceKit)
- Хабр - обзор API распознавания речи 2026 с замерами WER и цен на 1000 минут
- Хабр - распознавание двухканальных диалогов через Whisper, личный опыт
- Mymeet.ai - официальные тарифы и условия
- Mymeet.ai - официальный справочный центр про тарифы и ограничения
- vc.ru - ТОП-12 инструментов анализа звонков с ИИ для SMB
- vc.ru - обзор ИИ-ассистентов для встреч и саммари, 2026
- Voicee - сравнение 10 русскоязычных сервисов транскрибации 2026
- Хабр - кейс автоматизации контроля качества звонков и экономия в 5 миллионов
Решения Noltis по теме
Думаете внедрить расшифровку в работу команды?
Опишите задачу: сколько встреч в неделю, какая телефония, какие требования по приватности. За 24 часа верну сравнение под ваши вводные с ценой и сроками. Бесплатно, до подписания.
Обсудить задачу
Добавить комментарий