Genauigkeits-Benchmark
Wir haben unsere Genauigkeit gemessen. So haben wir es gemacht.
Im Google-FLEURS-Benchmark macht BriefVox in acht Sprachen etwa 5,3% Wortfehler pro 100 Wörter — mit unserer vorherigen Engine waren es 7,6%. Unten: jede Zahl, wie sie entstanden ist und wo sie nicht mehr gilt.
- durchschnittliche Wortfehlerrate, 8 Sprachen
- 5,3%
- Sprachen gemessen; 99 erkannt
- 8
- schneller als Echtzeit (Parakeet-Schritt)
- 38×
- vorherige Engine, gleicher Test
- 7,6%
Wortfehlerrate nach Sprache
Niedriger ist besser. Jede Sprache ist eine 5–8-minütige Datei aus 30 aneinandergereihten FLEURS-Sätzen, transkribiert mit automatischer Spracherkennung — so wie Ihre Uploads verarbeitet werden.
| Sprache | Engine in Produktion | WER heute | Vorherige Engine | HeuteVorherige Engine |
|---|---|---|---|---|
| Englisch | Whisper large-v3-turbo | 5,4% | 3,8% | |
| Polnisch | Parakeet-TDT-0.6B-v3 | 8,7% | 7,5% | |
| Deutsch | Parakeet-TDT-0.6B-v3 | 7,4% | 8,8% | |
| Spanisch | Parakeet-TDT-0.6B-v3 | 3,0% | 4,5% | |
| Französisch | Parakeet-TDT-0.6B-v3 | 4,9% | 8,1% | |
| Italienisch | Parakeet-TDT-0.6B-v3 | 3,5% | 13,7% | |
| Portugiesisch | Parakeet-TDT-0.6B-v3 | 4,4% | 8,3% | |
| Russisch | Whisper large-v3-turbo | 5,1% | 6,0% | |
| Durchschnitt | 5,3% | 7,6% |
Gemessen am 1. Oktober 2026 auf der GPU, die in Produktion transkribiert. Wo die vorherige Engine besser aussieht (Englisch, Polnisch), hielt der Vorsprung einer größeren Stichprobe nicht stand — siehe die Messung mit 80 Sätzen unten.
Warum zwei Engines
Kein einzelnes Modell gewann in allen Sprachen. Deshalb leitet BriefVox jede Aufnahme an die Engine weiter, die für ihre Sprache am besten abschnitt. Whisper erkennt außerdem die Sprache und deckt alles außerhalb der 25 europäischen Sprachen von Parakeet ab.
| Engine | Durchschnittliche WER | Geschwindigkeit |
|---|---|---|
| NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp32 | 5,5% | 37,8× Echtzeit |
| OpenAI Whisper large-v3-turboint8, beam 5 | 6,3% | 10,8× Echtzeit |
| OpenAI Whisper large-v3int8, beam 10 — previous production setting | 7,6% | 4,4× Echtzeit |
Knappe Ergebnisse, nachgeprüft
Dreißig Sätze sind etwa 700 Wörter pro Sprache, ein Punkt Unterschied sind also nur ein paar Wörter. Wo die Spitzenreiter nah beieinander lagen (Englisch, Deutsch, Polnisch, Russisch), haben wir mit 80 Sätzen nachgemessen. Deutsch und Polnisch endeten unentschieden, also übernimmt die 3× schnellere Engine; Englisch und Russisch bleiben bei Whisper.
| Engine | EN | DE | PL | RU |
|---|---|---|---|---|
| Whisper large-v3 | 4,7% | — | — | 6,1% |
| Whisper large-v3-turbo | 4,8% | 5,5% | 7,2% | 4,8% |
| Parakeet-TDT-0.6B-v3 | 5,3% | 5,4% | 7,1% | 6,5% |
Methode
Daten
Google-FLEURS-Testsatz für die acht Sprachen der Oberfläche. Die Sätze werden mit 0,6 s Pause zu einer langen Datei verbunden, weil echte Uploads lang sind — Segmentierung und Spracherkennung werden mitgemessen.
Pegel
Jeder Satz wird vor dem Zusammenfügen auf dieselbe Lautheit (−23 dBFS) gebracht, da unsere Pipeline die Lautheit vor der Erkennung ohnehin normalisiert.
Metrik
Wortfehlerrate nach derselben Normalisierung für jede Engine: Kleinschreibung, ohne Satzzeichen und Symbole. Zahlen werden nicht angeglichen („25“ vs. „fünfundzwanzig“), was jede Engine ein wenig kostet.
Geschwindigkeit
Sekunden Audio pro Sekunde Verarbeitung auf der Produktions-GPU (NVIDIA GTX 1060 6 GB), ohne Laden des Modells.
Was diese Zahlen nicht sagen
- FLEURS ist deutlich vorgelesene Sprache. Laute Räume, Durcheinanderreden, Telefonaudio und starke Akzente erzeugen mehr Fehler — jedes Wort können Sie im Editor korrigieren.
- Etwa 700 Wörter pro Sprache: Unterschiede unter einem Punkt liegen im Rauschen.
- Die Wortfehlerrate zählt Wörter, nicht Sprecherzuordnung oder Zeitmarken; diese entstehen in separaten Schritten (Alignment und Diarisierung).
- Gemessen wird nur die Erkennung. Ein ganzer Auftrag umfasst auch Upload, Wort-Alignment, Sprechererkennung und Speichern und dauert daher länger, als die Geschwindigkeit nahelegt.
Was mit Ihrer Datei passiert
- 1Whisper large-v3-turbo erkennt die Sprache aus mehreren 30-Sekunden-Fenstern über die ganze Aufnahme, nicht nur aus dem Intro.
- 2Die Aufnahme geht an die Engine, die für diese Sprache am besten abschnitt; scheitert Parakeet oder kennt die Sprache nicht, übernimmt Whisper.
- 3Jedes Wort wird per Forced Alignment getimt, und die Sprecher trennt pyannote.
Selbst nachmessen
Die Benchmark-Skripte laden FLEURS, führen jede Engine aus und werten das Ergebnis aus. Genau diese Befehle stehen hinter der Tabelle:
python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
--repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
--out results/turbo.jsonl
python score.py results/*.jsonlTesten Sie es mit Ihrer eigenen Aufnahme
20 Gratisminuten jeden Monat, ohne Karte. Entscheidend ist der Benchmark mit Ihrem Ton.
Kostenlos starten