Przejdź do treści

Benchmark dokładności

Zmierzyliśmy naszą dokładność. Oto dokładnie jak.

W benchmarku Google FLEURS BriefVox myli się średnio w 5,3% słowach na 100 w ośmiu językach — wcześniej, na poprzednim silniku, w 7,6%. Poniżej każda liczba, sposób pomiaru i granice, w których te wyniki obowiązują.

średni błąd słów, 8 języków
5,3%
zmierzonych języków; 99 rozpoznawanych
8
szybciej niż w czasie rzeczywistym (etap Parakeet)
38×
poprzedni silnik, ten sam test
7,6%

Błąd słów według języka

Im mniej, tym lepiej. Każdy język to 5–8-minutowy plik z 30 połączonych zdań FLEURS, transkrybowany z automatycznym wykrywaniem języka — tak jak Twoje pliki.

Błąd słów według języka
JęzykSilnik na produkcjiWER dziśPoprzedni silnikDziśPoprzedni silnik
angielskiWhisper large-v3-turbo5,4%3,8%
polskiParakeet-TDT-0.6B-v38,7%7,5%
niemieckiParakeet-TDT-0.6B-v37,4%8,8%
hiszpańskiParakeet-TDT-0.6B-v33,0%4,5%
francuskiParakeet-TDT-0.6B-v34,9%8,1%
włoskiParakeet-TDT-0.6B-v33,5%13,7%
portugalskiParakeet-TDT-0.6B-v34,4%8,3%
rosyjskiWhisper large-v3-turbo5,1%6,0%
Średnio5,3%7,6%

Zmierzono 1 października 2026 na GPU, które obsługuje transkrypcje na produkcji. Tam, gdzie poprzedni silnik wygląda lepiej (angielski, polski), przewaga nie utrzymała się na większej próbie — zobacz pomiar na 80 zdaniach niżej.

Dlaczego dwa silniki

Żaden model nie wygrał we wszystkich językach, więc BriefVox kieruje każde nagranie do silnika, który dla danego języka wypadł najlepiej. Whisper rozpoznaje też język i obsługuje wszystko spoza 25 europejskich języków Parakeeta.

SilnikŚredni WERSzybkość
NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp325,5%37,8× czas rzeczywisty
OpenAI Whisper large-v3-turboint8, beam 56,3%10,8× czas rzeczywisty
OpenAI Whisper large-v3int8, beam 10 — previous production setting7,6%4,4× czas rzeczywisty

Wyrównane wyniki — sprawdzone ponownie

Trzydzieści zdań to ok. 700 słów na język, więc różnica jednego punktu to kilka słów. Tam, gdzie liderzy byli blisko (angielski, niemiecki, polski, rosyjski), powtórzyliśmy pomiar na 80 zdaniach. Niemiecki i polski wyszły na remis, więc bierze je 3× szybszy silnik; angielski i rosyjski zostają na Whisperze.

SilnikENDEPLRU
Whisper large-v34,7%——6,1%
Whisper large-v3-turbo4,8%5,5%7,2%4,8%
Parakeet-TDT-0.6B-v35,3%5,4%7,1%6,5%

Metoda

Dane

Zbiór testowy Google FLEURS dla ośmiu języków interfejsu. Zdania są łączone z 0,6 s przerwy w jeden długi plik, bo prawdziwe nagrania są długie — segmentacja i wykrywanie mowy też są mierzone.

Poziom

Każde zdanie ma przed połączeniem tę samą głośność (−23 dBFS), bo nasz pipeline i tak normalizuje głośność przed rozpoznawaniem.

Miara

Błąd słów po tej samej normalizacji dla każdego silnika: małe litery, bez interpunkcji i symboli. Liczby nie są ujednolicane („25” a „dwadzieścia pięć”), co każdemu silnikowi trochę dokłada.

Szybkość

Sekundy nagrania na sekundę przetwarzania na produkcyjnym GPU (NVIDIA GTX 1060 6 GB), bez ładowania modelu.

Czego te liczby nie mówią

  • FLEURS to wyraźnie czytana mowa. Hałas, nakładające się głosy, nagrania z telefonu i mocne akcenty dają więcej błędów — każde słowo poprawisz w edytorze.
  • Ok. 700 słów na język: różnice poniżej punktu mieszczą się w szumie.
  • WER liczy słowa, a nie przypisanie rozmówców czy znaczniki czasu — te powstają w osobnych krokach wyrównania i diaryzacji.
  • Mierzymy samo rozpoznawanie. Całe zadanie obejmuje też wgranie, wyrównanie słów, rozpoznanie rozmówców i zapis, więc trwa dłużej, niż wynika z szybkości.

Co dzieje się z Twoim plikiem

  1. 1Whisper large-v3-turbo rozpoznaje język z kilku 30-sekundowych fragmentów z całego nagrania, a nie tylko ze wstępu.
  2. 2Nagranie trafia do silnika, który dla tego języka wypadł najlepiej; jeśli Parakeet zawiedzie albo nie zna języka, przejmuje Whisper.
  3. 3Każde słowo dostaje czas dzięki wymuszonemu wyrównaniu, a rozmówców rozdziela pyannote.

Powtórz pomiar

Skrypty benchmarku pobierają FLEURS, uruchamiają każdy silnik i liczą wynik. To dokładnie te polecenia, z których powstała tabela:

python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
    --repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
    --out results/turbo.jsonl
python score.py results/*.jsonl

Sprawdź na własnym nagraniu

20 darmowych minut co miesiąc, bez karty. Liczy się benchmark na Twoim dźwięku.

Zacznij za darmo