Benchmark di precisione
Abbiamo misurato la nostra precisione. Ecco esattamente come.
Nel benchmark Google FLEURS, BriefVox commette circa 5,3% errori ogni 100 parole in otto lingue — con il nostro motore precedente erano 7,6%. Qui sotto: ogni numero, come l’abbiamo ottenuto e dove smette di valere.
- tasso medio di errori sulle parole, 8 lingue
- 5,3%
- lingue misurate; 99 riconosciute
- 8
- più veloce del tempo reale (fase Parakeet)
- 38×
- motore precedente, stesso test
- 7,6%
Tasso di errore sulle parole per lingua
Più basso è meglio. Ogni lingua è un file di 5–8 minuti composto da 30 frasi FLEURS unite, trascritto con rilevamento automatico della lingua — come i tuoi file.
| Lingua | Motore in produzione | WER oggi | Motore precedente | OggiMotore precedente |
|---|---|---|---|---|
| inglese | Whisper large-v3-turbo | 5,4% | 3,8% | |
| polacco | Parakeet-TDT-0.6B-v3 | 8,7% | 7,5% | |
| tedesco | Parakeet-TDT-0.6B-v3 | 7,4% | 8,8% | |
| spagnolo | Parakeet-TDT-0.6B-v3 | 3,0% | 4,5% | |
| francese | Parakeet-TDT-0.6B-v3 | 4,9% | 8,1% | |
| italiano | Parakeet-TDT-0.6B-v3 | 3,5% | 13,7% | |
| portoghese | Parakeet-TDT-0.6B-v3 | 4,4% | 8,3% | |
| russo | Whisper large-v3-turbo | 5,1% | 6,0% | |
| Media | 5,3% | 7,6% |
Misurato il 1 ottobre 2026 sulla GPU che trascrive in produzione. Dove il motore precedente sembra migliore (inglese, polacco), il vantaggio non ha retto su un campione più ampio — vedi la misura con 80 frasi qui sotto.
Perché due motori
Nessun modello ha vinto in tutte le lingue, quindi BriefVox invia ogni registrazione al motore che ha ottenuto il risultato migliore per la sua lingua. Whisper inoltre riconosce la lingua e copre tutto ciò che è fuori dalle 25 lingue europee di Parakeet.
| Motore | WER medio | Velocità |
|---|---|---|
| NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp32 | 5,5% | 37,8× tempo reale |
| OpenAI Whisper large-v3-turboint8, beam 5 | 6,3% | 10,8× tempo reale |
| OpenAI Whisper large-v3int8, beam 10 — previous production setting | 7,6% | 4,4× tempo reale |
Risultati ravvicinati, ricontrollati
Trenta frasi sono circa 700 parole per lingua, quindi un punto di differenza è solo qualche parola. Dove i migliori erano vicini (inglese, tedesco, polacco, russo) abbiamo ripetuto la misura con 80 frasi. Tedesco e polacco sono finiti in parità, quindi li prende il motore 3× più veloce; inglese e russo restano a Whisper.
| Motore | EN | DE | PL | RU |
|---|---|---|---|---|
| Whisper large-v3 | 4,7% | — | — | 6,1% |
| Whisper large-v3-turbo | 4,8% | 5,5% | 7,2% | 4,8% |
| Parakeet-TDT-0.6B-v3 | 5,3% | 5,4% | 7,1% | 6,5% |
Metodo
Dati
Set di test Google FLEURS per le otto lingue dell’interfaccia. Le frasi vengono unite con pause di 0,6 s in un unico file lungo, perché i file reali sono lunghi: anche segmentazione e rilevamento del parlato vengono misurati.
Livello
Ogni frase viene portata alla stessa loudness (−23 dBFS) prima dell’unione, dato che la nostra pipeline normalizza comunque il volume prima del riconoscimento.
Metrica
Tasso di errore sulle parole dopo la stessa normalizzazione per ogni motore: minuscole, senza punteggiatura né simboli. I numeri non vengono uniformati («25» contro «venticinque»), il che penalizza un po’ ogni motore.
Velocità
Secondi di audio per secondo di elaborazione sulla GPU di produzione (NVIDIA GTX 1060 6 GB), escluso il caricamento del modello.
Cosa non dicono questi numeri
- FLEURS è parlato letto con chiarezza. Stanze rumorose, voci sovrapposte, audio telefonico e accenti marcati producono più errori — ogni parola si corregge nell’editor.
- Circa 700 parole per lingua: differenze inferiori a un punto rientrano nel rumore.
- Il tasso di errore conta le parole, non l’attribuzione degli speaker né i timecode, che derivano da passaggi separati di allineamento e diarizzazione.
- Si misura solo il riconoscimento. Un lavoro completo include anche caricamento, allineamento delle parole, riconoscimento degli speaker e salvataggio, quindi dura più di quanto suggerisca la velocità.
Cosa succede al tuo file
- 1Whisper large-v3-turbo rileva la lingua da diverse finestre di 30 secondi distribuite sulla registrazione, non solo dall’introduzione.
- 2La registrazione va al motore che ha ottenuto il risultato migliore per quella lingua; se Parakeet fallisce o non conosce la lingua, subentra Whisper.
- 3Ogni parola viene sincronizzata con l’allineamento forzato e pyannote separa gli speaker.
Riproducilo
Gli script del benchmark scaricano FLEURS, eseguono ogni motore e valutano il risultato. Questi sono esattamente i comandi dietro la tabella:
python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
--repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
--out results/turbo.jsonl
python score.py results/*.jsonlProvalo con la tua registrazione
20 minuti gratis ogni mese, senza carta. Il benchmark che conta è quello sul tuo audio.
Inizia gratis