Benchmark dokładności
Zmierzyliśmy naszą dokładność. Oto dokładnie jak.
W benchmarku Google FLEURS BriefVox myli się średnio w 5,3% słowach na 100 w ośmiu językach — wcześniej, na poprzednim silniku, w 7,6%. Poniżej każda liczba, sposób pomiaru i granice, w których te wyniki obowiązują.
- średni błąd słów, 8 języków
- 5,3%
- zmierzonych języków; 99 rozpoznawanych
- 8
- szybciej niż w czasie rzeczywistym (etap Parakeet)
- 38×
- poprzedni silnik, ten sam test
- 7,6%
Błąd słów według języka
Im mniej, tym lepiej. Każdy język to 5–8-minutowy plik z 30 połączonych zdań FLEURS, transkrybowany z automatycznym wykrywaniem języka — tak jak Twoje pliki.
| Język | Silnik na produkcji | WER dziś | Poprzedni silnik | DziśPoprzedni silnik |
|---|---|---|---|---|
| angielski | Whisper large-v3-turbo | 5,4% | 3,8% | |
| polski | Parakeet-TDT-0.6B-v3 | 8,7% | 7,5% | |
| niemiecki | Parakeet-TDT-0.6B-v3 | 7,4% | 8,8% | |
| hiszpański | Parakeet-TDT-0.6B-v3 | 3,0% | 4,5% | |
| francuski | Parakeet-TDT-0.6B-v3 | 4,9% | 8,1% | |
| włoski | Parakeet-TDT-0.6B-v3 | 3,5% | 13,7% | |
| portugalski | Parakeet-TDT-0.6B-v3 | 4,4% | 8,3% | |
| rosyjski | Whisper large-v3-turbo | 5,1% | 6,0% | |
| Średnio | 5,3% | 7,6% |
Zmierzono 1 października 2026 na GPU, które obsługuje transkrypcje na produkcji. Tam, gdzie poprzedni silnik wygląda lepiej (angielski, polski), przewaga nie utrzymała się na większej próbie — zobacz pomiar na 80 zdaniach niżej.
Dlaczego dwa silniki
Żaden model nie wygrał we wszystkich językach, więc BriefVox kieruje każde nagranie do silnika, który dla danego języka wypadł najlepiej. Whisper rozpoznaje też język i obsługuje wszystko spoza 25 europejskich języków Parakeeta.
| Silnik | Średni WER | Szybkość |
|---|---|---|
| NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp32 | 5,5% | 37,8× czas rzeczywisty |
| OpenAI Whisper large-v3-turboint8, beam 5 | 6,3% | 10,8× czas rzeczywisty |
| OpenAI Whisper large-v3int8, beam 10 — previous production setting | 7,6% | 4,4× czas rzeczywisty |
Wyrównane wyniki — sprawdzone ponownie
Trzydzieści zdań to ok. 700 słów na język, więc różnica jednego punktu to kilka słów. Tam, gdzie liderzy byli blisko (angielski, niemiecki, polski, rosyjski), powtórzyliśmy pomiar na 80 zdaniach. Niemiecki i polski wyszły na remis, więc bierze je 3× szybszy silnik; angielski i rosyjski zostają na Whisperze.
| Silnik | EN | DE | PL | RU |
|---|---|---|---|---|
| Whisper large-v3 | 4,7% | — | — | 6,1% |
| Whisper large-v3-turbo | 4,8% | 5,5% | 7,2% | 4,8% |
| Parakeet-TDT-0.6B-v3 | 5,3% | 5,4% | 7,1% | 6,5% |
Metoda
Dane
Zbiór testowy Google FLEURS dla ośmiu języków interfejsu. Zdania są łączone z 0,6 s przerwy w jeden długi plik, bo prawdziwe nagrania są długie — segmentacja i wykrywanie mowy też są mierzone.
Poziom
Każde zdanie ma przed połączeniem tę samą głośność (−23 dBFS), bo nasz pipeline i tak normalizuje głośność przed rozpoznawaniem.
Miara
Błąd słów po tej samej normalizacji dla każdego silnika: małe litery, bez interpunkcji i symboli. Liczby nie są ujednolicane („25” a „dwadzieścia pięć”), co każdemu silnikowi trochę dokłada.
Szybkość
Sekundy nagrania na sekundę przetwarzania na produkcyjnym GPU (NVIDIA GTX 1060 6 GB), bez ładowania modelu.
Czego te liczby nie mówią
- FLEURS to wyraźnie czytana mowa. Hałas, nakładające się głosy, nagrania z telefonu i mocne akcenty dają więcej błędów — każde słowo poprawisz w edytorze.
- Ok. 700 słów na język: różnice poniżej punktu mieszczą się w szumie.
- WER liczy słowa, a nie przypisanie rozmówców czy znaczniki czasu — te powstają w osobnych krokach wyrównania i diaryzacji.
- Mierzymy samo rozpoznawanie. Całe zadanie obejmuje też wgranie, wyrównanie słów, rozpoznanie rozmówców i zapis, więc trwa dłużej, niż wynika z szybkości.
Co dzieje się z Twoim plikiem
- 1Whisper large-v3-turbo rozpoznaje język z kilku 30-sekundowych fragmentów z całego nagrania, a nie tylko ze wstępu.
- 2Nagranie trafia do silnika, który dla tego języka wypadł najlepiej; jeśli Parakeet zawiedzie albo nie zna języka, przejmuje Whisper.
- 3Każde słowo dostaje czas dzięki wymuszonemu wyrównaniu, a rozmówców rozdziela pyannote.
Powtórz pomiar
Skrypty benchmarku pobierają FLEURS, uruchamiają każdy silnik i liczą wynik. To dokładnie te polecenia, z których powstała tabela:
python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
--repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
--out results/turbo.jsonl
python score.py results/*.jsonlSprawdź na własnym nagraniu
20 darmowych minut co miesiąc, bez karty. Liczy się benchmark na Twoim dźwięku.
Zacznij za darmo