Benchmark de précision
Nous avons mesuré notre précision. Voici exactement comment.
Sur le benchmark Google FLEURS, BriefVox fait environ 5,3% d’erreurs pour 100 mots sur huit langues — contre 7,6% avec notre moteur précédent. Ci-dessous : chaque chiffre, comment nous l’avons obtenu et où il cesse de s’appliquer.
- taux moyen d’erreurs de mots, 8 langues
- 5,3%
- langues mesurées ; 99 reconnues
- 8
- plus rapide que le temps réel (étape Parakeet)
- 38×
- moteur précédent, même test
- 7,6%
Taux d’erreurs de mots par langue
Plus c’est bas, mieux c’est. Chaque langue est un fichier de 5 à 8 minutes composé de 30 phrases FLEURS mises bout à bout, transcrit avec détection automatique de la langue — comme vos fichiers.
| Langue | Moteur en production | WER aujourd’hui | Moteur précédent | Aujourd’huiMoteur précédent |
|---|---|---|---|---|
| anglais | Whisper large-v3-turbo | 5,4% | 3,8% | |
| polonais | Parakeet-TDT-0.6B-v3 | 8,7% | 7,5% | |
| allemand | Parakeet-TDT-0.6B-v3 | 7,4% | 8,8% | |
| espagnol | Parakeet-TDT-0.6B-v3 | 3,0% | 4,5% | |
| français | Parakeet-TDT-0.6B-v3 | 4,9% | 8,1% | |
| italien | Parakeet-TDT-0.6B-v3 | 3,5% | 13,7% | |
| portugais | Parakeet-TDT-0.6B-v3 | 4,4% | 8,3% | |
| russe | Whisper large-v3-turbo | 5,1% | 6,0% | |
| Moyenne | 5,3% | 7,6% |
Mesuré le 1 octobre 2026 sur la GPU qui transcrit en production. Là où le moteur précédent semble meilleur (anglais, polonais), l’écart n’a pas tenu sur un échantillon plus grand — voir la mesure sur 80 phrases ci-dessous.
Pourquoi deux moteurs
Aucun modèle ne gagnait dans toutes les langues, alors BriefVox envoie chaque enregistrement au moteur qui a obtenu le meilleur score dans sa langue. Whisper identifie aussi la langue et couvre tout ce qui sort des 25 langues européennes de Parakeet.
| Moteur | WER moyen | Vitesse |
|---|---|---|
| NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp32 | 5,5% | 37,8× temps réel |
| OpenAI Whisper large-v3-turboint8, beam 5 | 6,3% | 10,8× temps réel |
| OpenAI Whisper large-v3int8, beam 10 — previous production setting | 7,6% | 4,4× temps réel |
Résultats serrés, revérifiés
Trente phrases, c’est environ 700 mots par langue : un point d’écart ne représente que quelques mots. Là où les meilleurs étaient proches (anglais, allemand, polonais, russe), nous avons refait la mesure avec 80 phrases. Allemand et polonais sont à égalité, donc le moteur 3× plus rapide les prend ; l’anglais et le russe restent sur Whisper.
| Moteur | EN | DE | PL | RU |
|---|---|---|---|---|
| Whisper large-v3 | 4,7% | — | — | 6,1% |
| Whisper large-v3-turbo | 4,8% | 5,5% | 7,2% | 4,8% |
| Parakeet-TDT-0.6B-v3 | 5,3% | 5,4% | 7,1% | 6,5% |
Méthode
Données
Jeu de test Google FLEURS pour les huit langues de l’interface. Les phrases sont assemblées avec 0,6 s de pause en un long fichier, car les vrais fichiers sont longs : la segmentation et la détection de la parole font partie de la mesure.
Niveau
Chaque phrase est ramenée au même niveau sonore (−23 dBFS) avant l’assemblage, puisque notre chaîne normalise de toute façon le volume avant la reconnaissance.
Métrique
Taux d’erreurs de mots après la même normalisation pour chaque moteur : minuscules, sans ponctuation ni symboles. Les nombres ne sont pas harmonisés (« 25 » contre « vingt-cinq »), ce qui pénalise un peu chaque moteur.
Vitesse
Secondes d’audio par seconde de traitement sur la GPU de production (NVIDIA GTX 1060 6 Go), chargement du modèle exclu.
Ce que ces chiffres ne disent pas
- FLEURS est de la parole lue distinctement. Les salles bruyantes, les voix qui se chevauchent, l’audio téléphonique et les accents marqués produisent plus d’erreurs — chaque mot se corrige dans l’éditeur.
- Environ 700 mots par langue : les écarts de moins d’un point restent dans le bruit.
- Le taux d’erreurs compte les mots, pas l’attribution des intervenants ni l’horodatage, qui viennent d’étapes distinctes d’alignement et de diarisation.
- Seule la reconnaissance est mesurée. Une tâche complète comprend aussi l’import, l’alignement des mots, l’identification des intervenants et l’enregistrement ; elle dure donc plus longtemps que ne le laisse penser la vitesse.
Ce qui arrive à votre fichier
- 1Whisper large-v3-turbo détecte la langue sur plusieurs fenêtres de 30 secondes réparties sur l’enregistrement, pas seulement sur l’introduction.
- 2L’enregistrement part vers le moteur le mieux classé pour cette langue ; si Parakeet échoue ou ne connaît pas la langue, Whisper prend le relais.
- 3Chaque mot est horodaté par alignement forcé, et pyannote sépare les intervenants.
Reproduisez-le
Les scripts du benchmark téléchargent FLEURS, exécutent chaque moteur et notent le résultat. Voici exactement les commandes derrière le tableau :
python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
--repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
--out results/turbo.jsonl
python score.py results/*.jsonlEssayez-le sur votre propre enregistrement
20 minutes offertes chaque mois, sans carte. Le benchmark qui compte, c’est votre audio.
Commencer gratuitement