Долгое время выбор локальной модели для расшифровки русской речи сводился к одному имени — Whisper. Он многоязычный, но русский для него — один из десятков языков, а точность на разговорной речи, звонках и записях с шумом оставляет желать лучшего. Модель GigaAM v3, разработанная в Сбере, устроена иначе: она с нуля создана под русский язык, обучена на сотнях тысяч часов русской речи и в версии e2e RNNT сразу выдаёт готовый текст — с запятыми, точками, заглавными буквами и числами цифрами. В формате GGUF она занимает менее полугигабайта, запускается на обычном процессоре без видеокарты и не требует Python. В этой статье подробно разберём, как она устроена, сколько весит каждый вариант файла и какую версию стоит брать.
Что такое GigaAM v3 и кто её сделал
GigaAM (Giga Acoustic Model) — семейство акустических моделей для русского языка от команды SberDevices. Модель описана в научной статье «GigaAM: Efficient Self-Supervised Learner for Speech Recognition», принятой на конференцию InterSpeech 2025. Третье поколение, GigaAM v3, — это Conformer-модель на 220–240 миллионов параметров, предобученная на огромном массиве русской речи с помощью самообучения (задача HuBERT-CTC). По сообщению авторов, в третьей версии в обучение добавили новые наборы данных: записи колл-центров, речь с фоновой музыкой, естественную разговорную речь и речь с нетипичными особенностями. Благодаря этому на новых доменах модели в среднем работают примерно на 30% лучше, а на публичных бенчмарках сохраняют качество предыдущих поколений.
Внутри семейства GigaAM v3 есть несколько вариантов: чистая предобученная модель (ssl), а также CTC- и RNN-T-версии в «обычном» и «e2e»-исполнении. Для практической транскрибации интересны именно e2e-версии, о которых поговорим ниже. Оригинальные веса опубликованы на Hugging Face в репозитории ai-sage/GigaAM-v3, исходный код — на GitHub: salute-developers/GigaAM. Лицензия — MIT, то есть модель можно свободно использовать, в том числе в коммерческих проектах.
Оригинал рассчитан на запуск через PyTorch. Для локальных приложений это тяжело, поэтому сообщество сконвертировало модель в формат GGUF — компактный формат для движков на базе ggml (на нём же работают llama.cpp и whisper.cpp). Готовые GGUF-файлы опубликованы, в частности, в репозиториях handy-computer/gigaam-v3-e2e-rnnt-gguf и cstr/gigaam-v3-GGUF.
Что значит «e2e»: пунктуация, регистр и цифры из коробки
Приставка e2e (end-to-end, «от начала до конца») — главное, что отличает эти варианты от обычных. Классическая русская ASR-модель выдаёт сплошной поток слов маленькими буквами без знаков препинания, причём числа записаны словами: «в две тысячи двадцать шестом году встретились сорок пять человек». Чтобы превратить это в читаемый текст, нужны дополнительные шаги: расстановка пунктуации, определение заглавных букв и обратная нормализация чисел. Каждый шаг — это отдельная модель, отдельная задержка и отдельный источник ошибок.
В e2e-версиях всё это умеет сама модель. Вот как выглядит разница:
Для авторов GigaAM это была отдельная инженерная задача. Для обучения e2e-моделей они создали обучающие разметки с пунктуацией и нормализацией: аудио и исходную расшифровку подавали большой мультимодальной модели GigaChat Max Audio, которая с помощью примеров из нескольких образцов возвращала текст с точной пунктуацией и нормализацией. Авторы отдельно отмечают, что простая расстановка знаков препинания «сверху» через Whisper даёт особенно слабые запятые, а обучение на таких разметках ухудшает общее качество. В итоге e2e-модели лучше расставляют запятые, чем подход «распознал, а потом расставил знаки».
Практический вывод
Для расшифровки интервью, лекций и совещаний e2e-версия избавляет от целого конвейера постобработки: на выходе уже читаемый текст, который можно сразу отправлять в документ или конспект.
Как устроена модель: Conformer и RNN-T
Энкодер: Conformer на 16 слоёв
Основа GigaAM v3 — Conformer-энкодер из 16 слоёв с размерностью 768 и позиционным кодированием RoPE. Conformer — архитектура, которая сочетает два подхода: механизм внимания (хорош в понимании глобального контекста фразы) и свёртки (хороши в улавливании локальных акустических деталей). Для распознавания речи такое сочетание оказалось особенно удачным, поэтому на Conformer построены многие современные модели, включая семейство Parakeet, о котором мы писали в статье про Parakeet TDT-CTC 110M.
RNN-T: декодер, который «слышит» и «помнит»
В версии RNNT к энкодеру добавлена предсказательная сеть (однослойная LSTM на 320 нейронов) и объединяющая сеть (joint network). Идея трансдьюсера в том, что декодер на каждом шаге учитывает не только акустику, но и уже распознанные слова. Это позволяет модели лучше понимать контекст: она «знает», какое слово логично после предыдущих, и реже выдаёт грамматически нелепые варианты. Словарь e2e RNNT — SentencePiece на 1024 токена, в который входят и буквы, и знаки препинания, и цифры.
CTC: проще и быстрее
CTC-вариант устроен иначе: после энкодера идёт простая линейная «голова», которая независимо для каждого кадра предсказывает токен. Здесь нет предсказательной сети и пошагового декодирования, поэтому расшифровка быстрее, но у модели меньше возможностей учитывать языковой контекст. Подробнее сравним оба варианта ниже.
Вес модели: F32, F16, Q8_0 и Q4_K
Несжатые веса модели в формате F32 занимают около 850 МБ. Версии GGUF компактнее. Ниже — данные для e2e RNNT из репозитория handy-computer/gigaam-v3-e2e-rnnt-gguf вместе с ошибкой распознавания на русской части датасета FLEURS:
| Формат | Размер | К F32 | WER, FLEURS (ru) |
|---|---|---|---|
| F32 (без сжатия) | 849 МБ | 100% | 5,35% |
| F16 ★ | 431 МБ | ≈ 51% | 5,35% |
| Q8_0 | 261 МБ | ≈ 31% | 5,36% |
| Q6_K | 217 МБ | ≈ 26% | 5,37% |
| Q5_K_M | 197 МБ | ≈ 23% | 5,42% |
| Q4_K_M | 175 МБ | ≈ 21% | 5,36% |
В другой популярной сборке — cstr/gigaam-v3-GGUF для движка CrispASR — файлы немного отличаются по размеру (разные способы подсчёта и состав тензоров): gigaam-v3-e2e-rnnt-f16.gguf около 452 МБ, q8_0 — 249 МБ, q4_k — 154 МБ. Общая картина та же: F16 весит чуть меньше полугигабайта, Q4 — примерно 150–175 МБ.
Заметьте, что разница между F16 и Q4 — примерно 255 МБ. На современном компьютере это пренебрежимо мало, особенно с учётом того, что вся модель целиком загружается в память за секунду.
F16 против Q4: почему «лёгкая» не значит «лучше»
Логика «чем меньше файл, тем быстрее работает» верна далеко не всегда. Для GigaAM v3 на практике F16 оказывается и быстрее, и точнее Q4. Вот почему.
- Скорость. Квантованные веса нужно «разворачивать» обратно в числа, с которыми умеет работать процессор, и делается это прямо во время вычислений. У огромных языковых моделей эта работа окупается экономией памяти, ведь там узкое место — чтение весов из ОЗУ. У модели на 220 миллионов параметров всё иначе: она относительно небольшая, и основное время уходит на сами вычисления. Дополнительная распаковка Q4 съедает потенциальный выигрыш, и F16 в наших замерах отрабатывает быстрее.
- Заглавные буквы и знаки препинания. Это самое важное для e2e-модели. По проверке авторов сборки cstr, при квантовании Q4_K у e2e RNNT содержание текста остаётся тем же, но четыре слова теряют заглавную букву. На словах цифра кажется мелкой, но e2e-модель выбирают именно ради регистра и пунктуации — и квантование до 4 бит бьёт как раз по ним. Версия F16 при этом даёт побайтно идентичный результат с эталоном на PyTorch.
- Метрика WER этого не показывает. Обратите внимание на таблицу выше: на FLEURS ошибка распознавания слов у Q4_K_M и F16 практически одинакова (5,36% и 5,35%). Это не противоречие: стандартный WER, как правило, считается после приведения текста к единому виду и не учитывает регистр и знаки препинания. Поэтому судить о качестве e2e-модели только по WER нельзя — смотреть нужно на итоговый текст.
- Экономия не критична. Выигрыш от Q4 — около 255 МБ. Он имеет смысл только на очень ограниченных устройствах, но не на обычном ПК или ноутбуке.
А что с Q8_0?
Q8_0 — разумный компромисс: 261 МБ, качество практически не отличается от F16. Авторы сборки cstr вообще рекомендуют именно его как вариант «по умолчанию» (они ориентируются на баланс размера и качества). Если для вас критичен размер дистрибутива — берите Q8_0. Если важны максимальная скорость и точность на обычном компьютере — F16.
Хочется ещё быстрее: e2e CTC в F16
Если вам нужна максимальная скорость, а разница в качестве не критична, у GigaAM v3 есть более быстрый брат — e2e CTC. Это та же основа, но с упрощённым CTC-декодером вместо трансдьюсера. И важное уточнение: e2e CTC тоже расставляет знаки препинания и заглавные буквы, как и e2e RNNT — ему тоже не нужна постобработка. Словарь у него поменьше (SentencePiece на 256 токенов), а декодирование проще — отсюда выигрыш в скорости.
| Файл (handy-computer) | Размер | WER, FLEURS (ru) |
|---|---|---|
gigaam-v3-e2e-ctc-F16.gguf ★ |
428 МБ | 5,50% |
gigaam-v3-e2e-ctc-Q8_0.gguf |
260 МБ | 5,50% |
gigaam-v3-e2e-ctc-Q4_K_M.gguf |
174 МБ | 5,57% |
Здесь картина с квантованием такая же, как у RNNT: F16 — самый точный вариант и при этом на обычном CPU не медленнее Q4, а в наших замерах быстрее. Поэтому если вы выбрали CTC ради скорости, берите именно gigaam-v3-e2e-ctc-F16.gguf.
RNNT или CTC: что выбрать
Сравнение двух e2e-вариантов по данным авторов GigaAM (точность расстановки знаков и WER на их внутреннем тесте):
| Параметр | e2e CTC | e2e RNNT |
|---|---|---|
| F1 по запятым | 83,7 | 84,5 |
| F1 по точкам | 86,7 | 86,7 |
| F1 по вопросительным знакам | 78,6 | 79,8 |
| WER (с пунктуацией и нормализацией) | 16,0% | 14,2% |
| CER | 8,7% | 8,8% |
| Скорость декодирования | выше | ниже |
| Размер в F16 | 428 МБ | 431 МБ |
Разница в качестве невелика: RNNT лучше по запятым и вопросительным знакам и заметно точнее по WER на сложной полной нормализации. CTC почти не уступает по пунктуации и выигрывает в скорости. Практическое правило простое: RNNT — когда важнее точность, CTC — когда нужно обработать много часов записей как можно быстрее. Размер файлов при этом почти одинаков.
Качество на русском: что показывают метрики
Авторы GigaAM публикуют результаты на десяти русскоязычных наборах — от чистых голосовых записей до звонков и речи с нарушениями. Ниже — выборка для моделей без e2e-постобработки (метрика WER, чем меньше, тем лучше) и средние значения для всех вариантов:
| Набор данных | Тип речи | V3 RNNT, % | V3 CTC, % |
|---|---|---|---|
| Golos Crowd | Записи от людей на телефон | 2,4 | 2,8 |
| Mozilla Common Voice 19 | Чтение коротких фраз | 0,9 | 1,3 |
| Russian LibriSpeech | Аудиокниги | 4,4 | 4,7 |
| Natural Speech | Естественная разговорная речь | 6,9 | 7,8 |
| OpenSTT Audiobooks | Аудиокниги | 8,2 | 8,7 |
| Callcenter | Звонки в колл-центр | 9,5 | 10,3 |
| OpenSTT YouTube | Ролики с YouTube | 10,6 | 11,6 |
| OpenSTT Phone Calls | Телефонные разговоры | 17,4 | 18,6 |
| Disordered Speech | Речь с нарушениями | 19,2 | 20,6 |
| Среднее по всем наборам | 8,3 | 9,1 |
Для e2e-версий авторы приводят средний WER 11,2% (RNNT) и 12,0% (CTC) — они выше, потому что e2e-модели решают более сложную задачу: ставят знаки препинания и нормализуют числа, а оценка идёт после приведения к одному виду, что вносит дополнительные расхождения. Также стоит помнить, что на «живой» речи в звонках и со смазанной дикцией ошибок всегда больше, чем на чтении.
GigaAM или Whisper: сравнение для русского языка
По данным самих авторов, на русских наборах средний WER у Whisper-large-v3 (после того же приведения текста к единому виду) — около 21,0% против 11,2% у e2e RNNT. На звонках в колл-центр разрыв особенно заметен: 12,6% против 23,1%. А в сравнении с помощью LLM-судьи (модель Gemini 2.5 Pro оценивала пары расшифровок вслепую) e2e-модели GigaAM v3 побеждают Whisper-large-v3 в среднем с соотношением 70:30.
Нужно честно оговориться: эти цифры публикуют сами разработчики, оценка на их же наборах и по их методике. Независимые измерения могут отличаться, поэтому для ответственных задач имеет смысл один раз прогнать обе модели на собственных записях. Но общая картина понятна: специализированная модель, обученная на русском, на русском же и выигрывает у универсальной.
Преимущества Whisper при этом остаются: он понимает десятки языков, умеет переводить и устойчив к смешанной речи. GigaAM v3 решает одну задачу — расшифровку русского языка — и решает её лучше и намного компактнее.
Что с точностью по скорости
На независимом бенчмарке models.handy.computer версия e2e RNNT в Q8_0 на ноутбучном процессоре AMD Ryzen 4750U (модель 2020 года) работает примерно в 8 раз быстрее реального времени, а на встроенной графике того же ноутбука — примерно в 22 раза. Это ориентир именно для слабого железа: на современных процессорах результат заметно выше. Точные цифры зависят от процессора, числа потоков и самой записи, поэтому лучше один раз проверить на своём компьютере.
Ограничения, о которых нужно знать
Модель заточена под русский язык
GigaAM v3 обучена на русской речи. Для английского она не подходит — для него лучше взять Parakeet, о котором мы писали в отдельной статье. У авторов есть и отдельная многоязычная модель GigaAM Multilingual (русский, казахский, киргизский, узбекский и английский), но это другая линейка.
- Короткие фрагменты. Модели такого класса обучаются на коротких отрезках речи, поэтому длинные записи нужно резать на куски — обычно по паузам с помощью детектора речи (VAD). Конкретные лимиты зависят от используемого движка, смотрите его документацию.
- Формат аудио. На входе нужен звук 16 кГц, моно. Любой другой файл проще всего привести к этому виду через FFmpeg — готовые команды есть в нашей шпаргалке по FFmpeg.
- Нет разметки говорящих. Модель не отвечает на вопрос «кто говорит». Для диаризации нужны отдельные модели.
- Шум снижает точность. Как и любая ASR-модель, GigaAM лучше работает на чистом звуке. Предварительная очистка записи заметно помогает — подробности в статье про удаление шума микрофона нейросетями.
- Нормализация иногда ошибается. Автоматическая запись чисел, дат и сокращений в e2e-моделях удобна, но не безупречна: на редких форматах (артикулы, длинные номера) стоит проверять результат глазами.
Где скачать: ссылки на Hugging Face и GitHub
- handy-computer/gigaam-v3-e2e-rnnt-gguf — GGUF-файлы e2e RNNT (F32, F16, Q8_0, Q6_K, Q5_K_M, Q4_K_M) для движка transcribe.cpp.
- handy-computer/gigaam-v3-e2e-ctc-gguf — та же линейка для e2e CTC.
- cstr/gigaam-v3-GGUF — альтернативная сборка всех четырёх вариантов (e2e RNNT, e2e CTC, RNNT, CTC) в F16, Q8_0 и Q4_K для движка CrispASR.
- ai-sage/GigaAM-v3 — оригинальная карточка модели от авторов: оригинальные веса, примеры использования, описание вариантов.
- salute-developers/GigaAM — официальный репозиторий с кодом, примерами и метриками.
- evaluation.md — полные результаты авторов на русских наборах и сравнение с Whisper.
- handy-computer/transcribe.cpp — движок на ggml, который запускает GGUF-версии GigaAM и Whisper на CPU и GPU.
- CrispStrobe/CrispASR — ещё один движок с поддержкой GigaAM.
- Научная статья GigaAM (arXiv) — описание подхода и результатов.
Лицензия на модель — MIT: можно использовать в коммерческих проектах без особых ограничений, достаточно сохранить текст лицензии.
Как запустить
Шагов три: скачать модель, привести аудио к нужному формату, запустить расшифровку.
Шаг 1. Скачиваем модель
Шаг 2. Готовим аудио
Шаг 3. Запускаем расшифровку
Точный набор параметров и актуальные команды зависят от версии движка, поэтому сверяйтесь с README выбранного проекта: они активно развиваются, и опции могут меняться. Если вам нужен более общий разбор того, как расшифровывать записи на Windows, посмотрите нашу статью про перевод аудио в текст бесплатно, а для работы с таймкодами — материал про перевод видео в текст с таймкодами.
Какую версию выбрать
e2e RNNT F16 — gigaam-v3-e2e-rnnt-F16.gguf
431 МБ. Лучшая точность среди e2e-вариантов, текст сразу с пунктуацией, заглавными буквами и цифрами. На обычном CPU F16 быстрее Q4 и сохраняет регистр. Берите, если нужна лучшая расшифровка русской речи.
e2e CTC F16 — gigaam-v3-e2e-ctc-F16.gguf
428 МБ. Проще декодер — выше скорость, при этом тоже расставляет знаки препинания и заглавные буквы. Чуть уступает RNNT по запятым и общей точности. Подходит для больших архивов.
Q8_0 — gigaam-v3-e2e-rnnt-Q8_0.gguf
261 МБ. Качество практически как у F16, файл легче почти на 40%. Хороший выбор для упаковки модели в приложение.
Q4_K_M — gigaam-v3-e2e-rnnt-Q4_K_M.gguf
175 МБ. Самый маленький вариант, но без выигрыша в скорости на обычном ПК и с риском потерять заглавные буквы. Имеет смысл только там, где действительно мало места.
Частые вопросы
Расставляет ли GigaAM v3 знаки препинания и заглавные буквы?
Да, но только e2e-версии — e2e RNNT и e2e CTC. Обычные версии (без приставки e2e) выдают текст строчными буквами без знаков препинания, с числами словами. Поэтому для расшифровки «для чтения» берите именно e2e.
Почему F16 быстрее Q4, ведь файл Q4 меньше?
Квантованные веса нужно распаковывать прямо во время вычислений. У модели на ~220M параметров узкое место — не чтение памяти, а сами вычисления, поэтому дополнительная работа по распаковке Q4 не окупается. Конкретные цифры зависят от процессора, так что лучше проверить на своём железе.
В чём разница между e2e RNNT и e2e CTC?
Это один и тот же энкодер с разными декодерами. RNNT учитывает уже распознанные слова и немного точнее, особенно в запятых. CTC проще и быстрее, но чуть менее точен. Оба расставляют знаки препинания и заглавные буквы.
Нужна ли видеокарта?
Нет. Модель спокойно работает на процессоре. Движки умеют использовать и GPU (CUDA, Vulkan, Metal), но для одиночных расшифровок это необязательно.
Можно ли использовать модель в коммерческих проектах?
Да. GigaAM v3 распространяется по лицензии MIT, которая разрешает коммерческое использование. Тем не менее перед использованием сверьтесь с актуальным текстом лицензии в репозитории.
Лучше ли она Whisper на русском?
По результатам самих авторов — да, и заметно: средний WER на русских наборах примерно вдвое ниже, а в слепом сравнении через LLM-судью GigaAM побеждает в среднем 70:30. Но эти данные публикует разработчик, поэтому для важных задач стоит сравнить модели на собственных записях.
Поддерживает ли модель английский язык?
Нет, GigaAM v3 создана для русского. Для английского лучше использовать Parakeet TDT-CTC 110M или Whisper.
Выдаёт ли модель таймкоды?
Это зависит от движка. В описании на портале handy.computer для e2e RNNT указана поддержка меток времени на уровне токенов. Для субтитров этого достаточно, подробнее о форматах — в нашем гайде по автоматическим субтитрам.
Итог
GigaAM v3 e2e RNNT — одна из самых удобных открытых моделей для расшифровки русской речи. Она весит 431 МБ в формате F16, работает на обычном процессоре без видеокарты и сразу выдаёт готовый к чтению текст: со знаками препинания, заглавными буквами и числами цифрами. Из всех вариантов файла практичнее всего F16: он быстрее и надёжнее Q4, а выигрыш Q4 в размере на современном компьютере ничтожен и оборачивается потерей заглавных букв. Если нужна скорость, можно взять e2e CTC в F16 — он тоже ставит знаки препинания и регистр и немного уступает по точности запятых. Q8_0 подойдёт, когда важен размер файла.
Главное ограничение — язык: модель создана для русского. Для английской речи есть Parakeet, для многоязычных задач — Whisper. А если вы работаете с русскими записями — интервью, лекциями, звонками, совещаниями — GigaAM v3 стоит попробовать первой: это сильный, компактный и свободный инструмент, который можно запустить локально.