Скачать для Windows
Нейросети • 15 мин чтения

GigaAM v3 e2e RNNT (GGUF): лучшая локальная модель транскрибации русского языка

Подробно разбираем модель от Сбера, которая сразу выдаёт русский текст со знаками препинания, заглавными буквами и цифрами вместо числительных. Сколько весят F16, Q8_0 и Q4_K, почему F16 быстрее и точнее Q4, и какую версию взять, если хочется ещё быстрее — e2e CTC.

Долгое время выбор локальной модели для расшифровки русской речи сводился к одному имени — Whisper. Он многоязычный, но русский для него — один из десятков языков, а точность на разговорной речи, звонках и записях с шумом оставляет желать лучшего. Модель GigaAM v3, разработанная в Сбере, устроена иначе: она с нуля создана под русский язык, обучена на сотнях тысяч часов русской речи и в версии e2e RNNT сразу выдаёт готовый текст — с запятыми, точками, заглавными буквами и числами цифрами. В формате GGUF она занимает менее полугигабайта, запускается на обычном процессоре без видеокарты и не требует Python. В этой статье подробно разберём, как она устроена, сколько весит каждый вариант файла и какую версию стоит брать.

~220Mпараметров, Conformer-энкодер
431 МБвес e2e RNNT в формате F16
MITсвободная лицензия, в том числе для коммерции
0 GPUвидеокарта не нужна

Что такое GigaAM v3 и кто её сделал

GigaAM (Giga Acoustic Model) — семейство акустических моделей для русского языка от команды SberDevices. Модель описана в научной статье «GigaAM: Efficient Self-Supervised Learner for Speech Recognition», принятой на конференцию InterSpeech 2025. Третье поколение, GigaAM v3, — это Conformer-модель на 220–240 миллионов параметров, предобученная на огромном массиве русской речи с помощью самообучения (задача HuBERT-CTC). По сообщению авторов, в третьей версии в обучение добавили новые наборы данных: записи колл-центров, речь с фоновой музыкой, естественную разговорную речь и речь с нетипичными особенностями. Благодаря этому на новых доменах модели в среднем работают примерно на 30% лучше, а на публичных бенчмарках сохраняют качество предыдущих поколений.

Внутри семейства GigaAM v3 есть несколько вариантов: чистая предобученная модель (ssl), а также CTC- и RNN-T-версии в «обычном» и «e2e»-исполнении. Для практической транскрибации интересны именно e2e-версии, о которых поговорим ниже. Оригинальные веса опубликованы на Hugging Face в репозитории ai-sage/GigaAM-v3, исходный код — на GitHub: salute-developers/GigaAM. Лицензия — MIT, то есть модель можно свободно использовать, в том числе в коммерческих проектах.

Оригинал рассчитан на запуск через PyTorch. Для локальных приложений это тяжело, поэтому сообщество сконвертировало модель в формат GGUF — компактный формат для движков на базе ggml (на нём же работают llama.cpp и whisper.cpp). Готовые GGUF-файлы опубликованы, в частности, в репозиториях handy-computer/gigaam-v3-e2e-rnnt-gguf и cstr/gigaam-v3-GGUF.

Что значит «e2e»: пунктуация, регистр и цифры из коробки

Приставка e2e (end-to-end, «от начала до конца») — главное, что отличает эти варианты от обычных. Классическая русская ASR-модель выдаёт сплошной поток слов маленькими буквами без знаков препинания, причём числа записаны словами: «в две тысячи двадцать шестом году встретились сорок пять человек». Чтобы превратить это в читаемый текст, нужны дополнительные шаги: расстановка пунктуации, определение заглавных букв и обратная нормализация чисел. Каждый шаг — это отдельная модель, отдельная задержка и отдельный источник ошибок.

В e2e-версиях всё это умеет сама модель. Вот как выглядит разница:

Обычная модель → e2eобычная: в две тысячи двадцать шестом году встретились сорок пять человек и обсудили план e2e: В 2026 году встретились 45 человек и обсудили план.

Для авторов GigaAM это была отдельная инженерная задача. Для обучения e2e-моделей они создали обучающие разметки с пунктуацией и нормализацией: аудио и исходную расшифровку подавали большой мультимодальной модели GigaChat Max Audio, которая с помощью примеров из нескольких образцов возвращала текст с точной пунктуацией и нормализацией. Авторы отдельно отмечают, что простая расстановка знаков препинания «сверху» через Whisper даёт особенно слабые запятые, а обучение на таких разметках ухудшает общее качество. В итоге e2e-модели лучше расставляют запятые, чем подход «распознал, а потом расставил знаки».

Практический вывод

Для расшифровки интервью, лекций и совещаний e2e-версия избавляет от целого конвейера постобработки: на выходе уже читаемый текст, который можно сразу отправлять в документ или конспект.

Как устроена модель: Conformer и RNN-T

Энкодер: Conformer на 16 слоёв

Основа GigaAM v3 — Conformer-энкодер из 16 слоёв с размерностью 768 и позиционным кодированием RoPE. Conformer — архитектура, которая сочетает два подхода: механизм внимания (хорош в понимании глобального контекста фразы) и свёртки (хороши в улавливании локальных акустических деталей). Для распознавания речи такое сочетание оказалось особенно удачным, поэтому на Conformer построены многие современные модели, включая семейство Parakeet, о котором мы писали в статье про Parakeet TDT-CTC 110M.

RNN-T: декодер, который «слышит» и «помнит»

В версии RNNT к энкодеру добавлена предсказательная сеть (однослойная LSTM на 320 нейронов) и объединяющая сеть (joint network). Идея трансдьюсера в том, что декодер на каждом шаге учитывает не только акустику, но и уже распознанные слова. Это позволяет модели лучше понимать контекст: она «знает», какое слово логично после предыдущих, и реже выдаёт грамматически нелепые варианты. Словарь e2e RNNT — SentencePiece на 1024 токена, в который входят и буквы, и знаки препинания, и цифры.

CTC: проще и быстрее

CTC-вариант устроен иначе: после энкодера идёт простая линейная «голова», которая независимо для каждого кадра предсказывает токен. Здесь нет предсказательной сети и пошагового декодирования, поэтому расшифровка быстрее, но у модели меньше возможностей учитывать языковой контекст. Подробнее сравним оба варианта ниже.

Вес модели: F32, F16, Q8_0 и Q4_K

Несжатые веса модели в формате F32 занимают около 850 МБ. Версии GGUF компактнее. Ниже — данные для e2e RNNT из репозитория handy-computer/gigaam-v3-e2e-rnnt-gguf вместе с ошибкой распознавания на русской части датасета FLEURS:

Формат Размер К F32 WER, FLEURS (ru)
F32 (без сжатия) 849 МБ 100% 5,35%
F16 ★ 431 МБ ≈ 51% 5,35%
Q8_0 261 МБ ≈ 31% 5,36%
Q6_K 217 МБ ≈ 26% 5,37%
Q5_K_M 197 МБ ≈ 23% 5,42%
Q4_K_M 175 МБ ≈ 21% 5,36%

В другой популярной сборке — cstr/gigaam-v3-GGUF для движка CrispASR — файлы немного отличаются по размеру (разные способы подсчёта и состав тензоров): gigaam-v3-e2e-rnnt-f16.gguf около 452 МБ, q8_0 — 249 МБ, q4_k — 154 МБ. Общая картина та же: F16 весит чуть меньше полугигабайта, Q4 — примерно 150–175 МБ.

Заметьте, что разница между F16 и Q4 — примерно 255 МБ. На современном компьютере это пренебрежимо мало, особенно с учётом того, что вся модель целиком загружается в память за секунду.

F16 против Q4: почему «лёгкая» не значит «лучше»

Логика «чем меньше файл, тем быстрее работает» верна далеко не всегда. Для GigaAM v3 на практике F16 оказывается и быстрее, и точнее Q4. Вот почему.

А что с Q8_0?

Q8_0 — разумный компромисс: 261 МБ, качество практически не отличается от F16. Авторы сборки cstr вообще рекомендуют именно его как вариант «по умолчанию» (они ориентируются на баланс размера и качества). Если для вас критичен размер дистрибутива — берите Q8_0. Если важны максимальная скорость и точность на обычном компьютере — F16.

Хочется ещё быстрее: e2e CTC в F16

Если вам нужна максимальная скорость, а разница в качестве не критична, у GigaAM v3 есть более быстрый брат — e2e CTC. Это та же основа, но с упрощённым CTC-декодером вместо трансдьюсера. И важное уточнение: e2e CTC тоже расставляет знаки препинания и заглавные буквы, как и e2e RNNT — ему тоже не нужна постобработка. Словарь у него поменьше (SentencePiece на 256 токенов), а декодирование проще — отсюда выигрыш в скорости.

Файл (handy-computer) Размер WER, FLEURS (ru)
gigaam-v3-e2e-ctc-F16.gguf ★ 428 МБ 5,50%
gigaam-v3-e2e-ctc-Q8_0.gguf 260 МБ 5,50%
gigaam-v3-e2e-ctc-Q4_K_M.gguf 174 МБ 5,57%

Здесь картина с квантованием такая же, как у RNNT: F16 — самый точный вариант и при этом на обычном CPU не медленнее Q4, а в наших замерах быстрее. Поэтому если вы выбрали CTC ради скорости, берите именно gigaam-v3-e2e-ctc-F16.gguf.

RNNT или CTC: что выбрать

Сравнение двух e2e-вариантов по данным авторов GigaAM (точность расстановки знаков и WER на их внутреннем тесте):

Параметр e2e CTC e2e RNNT
F1 по запятым83,784,5
F1 по точкам86,786,7
F1 по вопросительным знакам78,679,8
WER (с пунктуацией и нормализацией)16,0%14,2%
CER8,7%8,8%
Скорость декодированиявышениже
Размер в F16428 МБ431 МБ

Разница в качестве невелика: RNNT лучше по запятым и вопросительным знакам и заметно точнее по WER на сложной полной нормализации. CTC почти не уступает по пунктуации и выигрывает в скорости. Практическое правило простое: RNNT — когда важнее точность, CTC — когда нужно обработать много часов записей как можно быстрее. Размер файлов при этом почти одинаков.

Качество на русском: что показывают метрики

Авторы GigaAM публикуют результаты на десяти русскоязычных наборах — от чистых голосовых записей до звонков и речи с нарушениями. Ниже — выборка для моделей без e2e-постобработки (метрика WER, чем меньше, тем лучше) и средние значения для всех вариантов:

Набор данных Тип речи V3 RNNT, % V3 CTC, %
Golos CrowdЗаписи от людей на телефон2,42,8
Mozilla Common Voice 19Чтение коротких фраз0,91,3
Russian LibriSpeechАудиокниги4,44,7
Natural SpeechЕстественная разговорная речь6,97,8
OpenSTT AudiobooksАудиокниги8,28,7
CallcenterЗвонки в колл-центр9,510,3
OpenSTT YouTubeРолики с YouTube10,611,6
OpenSTT Phone CallsТелефонные разговоры17,418,6
Disordered SpeechРечь с нарушениями19,220,6
Среднее по всем наборам8,39,1

Для e2e-версий авторы приводят средний WER 11,2% (RNNT) и 12,0% (CTC) — они выше, потому что e2e-модели решают более сложную задачу: ставят знаки препинания и нормализуют числа, а оценка идёт после приведения к одному виду, что вносит дополнительные расхождения. Также стоит помнить, что на «живой» речи в звонках и со смазанной дикцией ошибок всегда больше, чем на чтении.

GigaAM или Whisper: сравнение для русского языка

По данным самих авторов, на русских наборах средний WER у Whisper-large-v3 (после того же приведения текста к единому виду) — около 21,0% против 11,2% у e2e RNNT. На звонках в колл-центр разрыв особенно заметен: 12,6% против 23,1%. А в сравнении с помощью LLM-судьи (модель Gemini 2.5 Pro оценивала пары расшифровок вслепую) e2e-модели GigaAM v3 побеждают Whisper-large-v3 в среднем с соотношением 70:30.

Нужно честно оговориться: эти цифры публикуют сами разработчики, оценка на их же наборах и по их методике. Независимые измерения могут отличаться, поэтому для ответственных задач имеет смысл один раз прогнать обе модели на собственных записях. Но общая картина понятна: специализированная модель, обученная на русском, на русском же и выигрывает у универсальной.

Преимущества Whisper при этом остаются: он понимает десятки языков, умеет переводить и устойчив к смешанной речи. GigaAM v3 решает одну задачу — расшифровку русского языка — и решает её лучше и намного компактнее.

Что с точностью по скорости

На независимом бенчмарке models.handy.computer версия e2e RNNT в Q8_0 на ноутбучном процессоре AMD Ryzen 4750U (модель 2020 года) работает примерно в 8 раз быстрее реального времени, а на встроенной графике того же ноутбука — примерно в 22 раза. Это ориентир именно для слабого железа: на современных процессорах результат заметно выше. Точные цифры зависят от процессора, числа потоков и самой записи, поэтому лучше один раз проверить на своём компьютере.

Ограничения, о которых нужно знать

Модель заточена под русский язык

GigaAM v3 обучена на русской речи. Для английского она не подходит — для него лучше взять Parakeet, о котором мы писали в отдельной статье. У авторов есть и отдельная многоязычная модель GigaAM Multilingual (русский, казахский, киргизский, узбекский и английский), но это другая линейка.

Где скачать: ссылки на Hugging Face и GitHub

Лицензия на модель — MIT: можно использовать в коммерческих проектах без особых ограничений, достаточно сохранить текст лицензии.

Как запустить

Шагов три: скачать модель, привести аудио к нужному формату, запустить расшифровку.

Шаг 1. Скачиваем модель

Скачивание F16-версии e2e RNNT# через Hugging Face CLI huggingface-cli download handy-computer/gigaam-v3-e2e-rnnt-gguf gigaam-v3-e2e-rnnt-F16.gguf --local-dir models/ # или быстрый вариант e2e CTC в F16 huggingface-cli download handy-computer/gigaam-v3-e2e-ctc-gguf gigaam-v3-e2e-ctc-F16.gguf --local-dir models/

Шаг 2. Готовим аудио

Конвертация в 16 кГц моноffmpeg -i interview.mp4 -ar 16000 -ac 1 audio.wav

Шаг 3. Запускаем расшифровку

transcribe.cpp# сборка из репозитория handy-computer/transcribe.cpp build/bin/transcribe-cli -m models/gigaam-v3-e2e-rnnt-F16.gguf audio.wav CrispASR (сборка cstr)crispasr --backend gigaam -m gigaam-v3-e2e-rnnt-f16.gguf -f audio.wav

Точный набор параметров и актуальные команды зависят от версии движка, поэтому сверяйтесь с README выбранного проекта: они активно развиваются, и опции могут меняться. Если вам нужен более общий разбор того, как расшифровывать записи на Windows, посмотрите нашу статью про перевод аудио в текст бесплатно, а для работы с таймкодами — материал про перевод видео в текст с таймкодами.

Какую версию выбрать

Рекомендуем по умолчанию

e2e RNNT F16 — gigaam-v3-e2e-rnnt-F16.gguf

431 МБ. Лучшая точность среди e2e-вариантов, текст сразу с пунктуацией, заглавными буквами и цифрами. На обычном CPU F16 быстрее Q4 и сохраняет регистр. Берите, если нужна лучшая расшифровка русской речи.

Если хочется ещё быстрее

e2e CTC F16 — gigaam-v3-e2e-ctc-F16.gguf

428 МБ. Проще декодер — выше скорость, при этом тоже расставляет знаки препинания и заглавные буквы. Чуть уступает RNNT по запятым и общей точности. Подходит для больших архивов.

Компромисс по размеру

Q8_0 — gigaam-v3-e2e-rnnt-Q8_0.gguf

261 МБ. Качество практически как у F16, файл легче почти на 40%. Хороший выбор для упаковки модели в приложение.

Только для слабого железа

Q4_K_M — gigaam-v3-e2e-rnnt-Q4_K_M.gguf

175 МБ. Самый маленький вариант, но без выигрыша в скорости на обычном ПК и с риском потерять заглавные буквы. Имеет смысл только там, где действительно мало места.

Частые вопросы

Расставляет ли GigaAM v3 знаки препинания и заглавные буквы?

Да, но только e2e-версии — e2e RNNT и e2e CTC. Обычные версии (без приставки e2e) выдают текст строчными буквами без знаков препинания, с числами словами. Поэтому для расшифровки «для чтения» берите именно e2e.

Почему F16 быстрее Q4, ведь файл Q4 меньше?

Квантованные веса нужно распаковывать прямо во время вычислений. У модели на ~220M параметров узкое место — не чтение памяти, а сами вычисления, поэтому дополнительная работа по распаковке Q4 не окупается. Конкретные цифры зависят от процессора, так что лучше проверить на своём железе.

В чём разница между e2e RNNT и e2e CTC?

Это один и тот же энкодер с разными декодерами. RNNT учитывает уже распознанные слова и немного точнее, особенно в запятых. CTC проще и быстрее, но чуть менее точен. Оба расставляют знаки препинания и заглавные буквы.

Нужна ли видеокарта?

Нет. Модель спокойно работает на процессоре. Движки умеют использовать и GPU (CUDA, Vulkan, Metal), но для одиночных расшифровок это необязательно.

Можно ли использовать модель в коммерческих проектах?

Да. GigaAM v3 распространяется по лицензии MIT, которая разрешает коммерческое использование. Тем не менее перед использованием сверьтесь с актуальным текстом лицензии в репозитории.

Лучше ли она Whisper на русском?

По результатам самих авторов — да, и заметно: средний WER на русских наборах примерно вдвое ниже, а в слепом сравнении через LLM-судью GigaAM побеждает в среднем 70:30. Но эти данные публикует разработчик, поэтому для важных задач стоит сравнить модели на собственных записях.

Поддерживает ли модель английский язык?

Нет, GigaAM v3 создана для русского. Для английского лучше использовать Parakeet TDT-CTC 110M или Whisper.

Выдаёт ли модель таймкоды?

Это зависит от движка. В описании на портале handy.computer для e2e RNNT указана поддержка меток времени на уровне токенов. Для субтитров этого достаточно, подробнее о форматах — в нашем гайде по автоматическим субтитрам.

Итог

GigaAM v3 e2e RNNT — одна из самых удобных открытых моделей для расшифровки русской речи. Она весит 431 МБ в формате F16, работает на обычном процессоре без видеокарты и сразу выдаёт готовый к чтению текст: со знаками препинания, заглавными буквами и числами цифрами. Из всех вариантов файла практичнее всего F16: он быстрее и надёжнее Q4, а выигрыш Q4 в размере на современном компьютере ничтожен и оборачивается потерей заглавных букв. Если нужна скорость, можно взять e2e CTC в F16 — он тоже ставит знаки препинания и регистр и немного уступает по точности запятых. Q8_0 подойдёт, когда важен размер файла.

Главное ограничение — язык: модель создана для русского. Для английской речи есть Parakeet, для многоязычных задач — Whisper. А если вы работаете с русскими записями — интервью, лекциями, звонками, совещаниями — GigaAM v3 стоит попробовать первой: это сильный, компактный и свободный инструмент, который можно запустить локально.

GigaAM GGUF Транскрибация Русский язык Hugging Face Локальные нейросети