Zum Inhalt springen

Genauigkeits-Benchmark

Wir haben unsere Genauigkeit gemessen. So haben wir es gemacht.

Im Google-FLEURS-Benchmark macht BriefVox in acht Sprachen etwa 5,3% Wortfehler pro 100 Wörter — mit unserer vorherigen Engine waren es 7,6%. Unten: jede Zahl, wie sie entstanden ist und wo sie nicht mehr gilt.

durchschnittliche Wortfehlerrate, 8 Sprachen
5,3%
Sprachen gemessen; 99 erkannt
8
schneller als Echtzeit (Parakeet-Schritt)
38×
vorherige Engine, gleicher Test
7,6%

Wortfehlerrate nach Sprache

Niedriger ist besser. Jede Sprache ist eine 5–8-minütige Datei aus 30 aneinandergereihten FLEURS-Sätzen, transkribiert mit automatischer Spracherkennung — so wie Ihre Uploads verarbeitet werden.

Wortfehlerrate nach Sprache
SpracheEngine in ProduktionWER heuteVorherige EngineHeuteVorherige Engine
EnglischWhisper large-v3-turbo5,4%3,8%
PolnischParakeet-TDT-0.6B-v38,7%7,5%
DeutschParakeet-TDT-0.6B-v37,4%8,8%
SpanischParakeet-TDT-0.6B-v33,0%4,5%
FranzösischParakeet-TDT-0.6B-v34,9%8,1%
ItalienischParakeet-TDT-0.6B-v33,5%13,7%
PortugiesischParakeet-TDT-0.6B-v34,4%8,3%
RussischWhisper large-v3-turbo5,1%6,0%
Durchschnitt5,3%7,6%

Gemessen am 1. Oktober 2026 auf der GPU, die in Produktion transkribiert. Wo die vorherige Engine besser aussieht (Englisch, Polnisch), hielt der Vorsprung einer größeren Stichprobe nicht stand — siehe die Messung mit 80 Sätzen unten.

Warum zwei Engines

Kein einzelnes Modell gewann in allen Sprachen. Deshalb leitet BriefVox jede Aufnahme an die Engine weiter, die für ihre Sprache am besten abschnitt. Whisper erkennt außerdem die Sprache und deckt alles außerhalb der 25 europäischen Sprachen von Parakeet ab.

EngineDurchschnittliche WERGeschwindigkeit
NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp325,5%37,8× Echtzeit
OpenAI Whisper large-v3-turboint8, beam 56,3%10,8× Echtzeit
OpenAI Whisper large-v3int8, beam 10 — previous production setting7,6%4,4× Echtzeit

Knappe Ergebnisse, nachgeprüft

Dreißig Sätze sind etwa 700 Wörter pro Sprache, ein Punkt Unterschied sind also nur ein paar Wörter. Wo die Spitzenreiter nah beieinander lagen (Englisch, Deutsch, Polnisch, Russisch), haben wir mit 80 Sätzen nachgemessen. Deutsch und Polnisch endeten unentschieden, also übernimmt die 3× schnellere Engine; Englisch und Russisch bleiben bei Whisper.

EngineENDEPLRU
Whisper large-v34,7%——6,1%
Whisper large-v3-turbo4,8%5,5%7,2%4,8%
Parakeet-TDT-0.6B-v35,3%5,4%7,1%6,5%

Methode

Daten

Google-FLEURS-Testsatz für die acht Sprachen der Oberfläche. Die Sätze werden mit 0,6 s Pause zu einer langen Datei verbunden, weil echte Uploads lang sind — Segmentierung und Spracherkennung werden mitgemessen.

Pegel

Jeder Satz wird vor dem Zusammenfügen auf dieselbe Lautheit (−23 dBFS) gebracht, da unsere Pipeline die Lautheit vor der Erkennung ohnehin normalisiert.

Metrik

Wortfehlerrate nach derselben Normalisierung für jede Engine: Kleinschreibung, ohne Satzzeichen und Symbole. Zahlen werden nicht angeglichen („25“ vs. „fünfundzwanzig“), was jede Engine ein wenig kostet.

Geschwindigkeit

Sekunden Audio pro Sekunde Verarbeitung auf der Produktions-GPU (NVIDIA GTX 1060 6 GB), ohne Laden des Modells.

Was diese Zahlen nicht sagen

  • FLEURS ist deutlich vorgelesene Sprache. Laute Räume, Durcheinanderreden, Telefonaudio und starke Akzente erzeugen mehr Fehler — jedes Wort können Sie im Editor korrigieren.
  • Etwa 700 Wörter pro Sprache: Unterschiede unter einem Punkt liegen im Rauschen.
  • Die Wortfehlerrate zählt Wörter, nicht Sprecherzuordnung oder Zeitmarken; diese entstehen in separaten Schritten (Alignment und Diarisierung).
  • Gemessen wird nur die Erkennung. Ein ganzer Auftrag umfasst auch Upload, Wort-Alignment, Sprechererkennung und Speichern und dauert daher länger, als die Geschwindigkeit nahelegt.

Was mit Ihrer Datei passiert

  1. 1Whisper large-v3-turbo erkennt die Sprache aus mehreren 30-Sekunden-Fenstern über die ganze Aufnahme, nicht nur aus dem Intro.
  2. 2Die Aufnahme geht an die Engine, die für diese Sprache am besten abschnitt; scheitert Parakeet oder kennt die Sprache nicht, übernimmt Whisper.
  3. 3Jedes Wort wird per Forced Alignment getimt, und die Sprecher trennt pyannote.

Selbst nachmessen

Die Benchmark-Skripte laden FLEURS, führen jede Engine aus und werten das Ergebnis aus. Genau diese Befehle stehen hinter der Tabelle:

python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
    --repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
    --out results/turbo.jsonl
python score.py results/*.jsonl

Testen Sie es mit Ihrer eigenen Aufnahme

20 Gratisminuten jeden Monat, ohne Karte. Entscheidend ist der Benchmark mit Ihrem Ton.

Kostenlos starten