Перейти к содержимому

Бенчмарк точности

Мы измерили нашу точность. Вот как именно.

В бенчмарке Google FLEURS BriefVox ошибается примерно в 5,3% слов из 100 на восьми языках — на прежнем движке было 7,6%. Ниже — каждая цифра, как мы её получили и где она перестаёт работать.

средняя доля ошибок в словах, 8 языков
5,3%
языков измерено; 99 распознаётся
8
быстрее реального времени (этап Parakeet)
38×
прежний движок, тот же тест
7,6%

Доля ошибок в словах по языкам

Чем ниже, тем лучше. Каждый язык — файл на 5–8 минут из 30 склеенных фраз FLEURS, расшифрованный с автоматическим определением языка, как и ваши файлы.

Доля ошибок в словах по языкам
ЯзыкДвижок в работеWER сейчасПрежний движокСейчасПрежний движок
английскийWhisper large-v3-turbo5,4%3,8%
польскийParakeet-TDT-0.6B-v38,7%7,5%
немецкийParakeet-TDT-0.6B-v37,4%8,8%
испанскийParakeet-TDT-0.6B-v33,0%4,5%
французскийParakeet-TDT-0.6B-v34,9%8,1%
итальянскийParakeet-TDT-0.6B-v33,5%13,7%
португальскийParakeet-TDT-0.6B-v34,4%8,3%
русскийWhisper large-v3-turbo5,1%6,0%
Среднее5,3%7,6%

Измерено 1 октября 2026 г. на GPU, который расшифровывает записи в работе. Там, где прежний движок выглядит лучше (английский, польский), преимущество не подтвердилось на большей выборке — см. замер на 80 фразах ниже.

Почему два движка

Ни одна модель не победила во всех языках, поэтому BriefVox отправляет каждую запись тому движку, который показал лучший результат для её языка. Whisper также определяет язык и покрывает всё, что не входит в 25 европейских языков Parakeet.

ДвижокСредний WERСкорость
NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp325,5%37,8× реального времени
OpenAI Whisper large-v3-turboint8, beam 56,3%10,8× реального времени
OpenAI Whisper large-v3int8, beam 10 — previous production setting7,6%4,4× реального времени

Близкие результаты — перепроверены

Тридцать фраз — это около 700 слов на язык, так что разница в один пункт — несколько слов. Там, где лидеры шли вплотную (английский, немецкий, польский, русский), мы повторили замер на 80 фразах. Немецкий и польский — ничья, поэтому их берёт движок, работающий в 3 раза быстрее; английский и русский остаются на Whisper.

ДвижокENDEPLRU
Whisper large-v34,7%——6,1%
Whisper large-v3-turbo4,8%5,5%7,2%4,8%
Parakeet-TDT-0.6B-v35,3%5,4%7,1%6,5%

Методика

Данные

Тестовый набор Google FLEURS для восьми языков интерфейса. Фразы склеиваются с паузами 0,6 с в один длинный файл, потому что реальные записи длинные: сегментация и определение речи тоже входят в замер.

Уровень

Перед склейкой каждая фраза приводится к одной громкости (−23 dBFS) — наш конвейер и так нормализует громкость перед распознаванием.

Метрика

Доля ошибок в словах после одинаковой нормализации для всех движков: нижний регистр, без пунктуации и символов. Числа не унифицируются («25» и «двадцать пять»), что немного штрафует каждый движок.

Скорость

Секунды аудио на секунду обработки на рабочем GPU (NVIDIA GTX 1060 6 ГБ), без учёта загрузки модели.

Чего эти цифры не говорят

  • FLEURS — это чётко прочитанная речь. Шум, перебивающие друг друга голоса, звук с телефона и сильный акцент дают больше ошибок — любое слово можно исправить в редакторе.
  • Около 700 слов на язык: разница меньше одного пункта — в пределах шума.
  • Доля ошибок считает слова, а не разметку говорящих и таймкоды — их дают отдельные шаги выравнивания и диаризации.
  • Измеряется только распознавание. Полная задача включает загрузку, выравнивание слов, определение говорящих и сохранение, поэтому занимает больше времени, чем следует из скорости.

Что происходит с вашим файлом

  1. 1Whisper large-v3-turbo определяет язык по нескольким 30-секундным фрагментам по всей записи, а не только по вступлению.
  2. 2Запись уходит движку с лучшим результатом для этого языка; если Parakeet не справится или не знает язык, работу берёт Whisper.
  3. 3Каждое слово получает время через принудительное выравнивание, а говорящих разделяет pyannote.

Повторите замер

Скрипты бенчмарка скачивают FLEURS, запускают каждый движок и оценивают результат. Вот точные команды, стоящие за таблицей:

python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
    --repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
    --out results/turbo.jsonl
python score.py results/*.jsonl

Проверьте на своей записи

20 бесплатных минут каждый месяц, без карты. Важен бенчмарк на вашем звуке.

Начать бесплатно