Aller au contenu

Benchmark de précision

Nous avons mesuré notre précision. Voici exactement comment.

Sur le benchmark Google FLEURS, BriefVox fait environ 5,3% d’erreurs pour 100 mots sur huit langues — contre 7,6% avec notre moteur précédent. Ci-dessous : chaque chiffre, comment nous l’avons obtenu et où il cesse de s’appliquer.

taux moyen d’erreurs de mots, 8 langues
5,3%
langues mesurées ; 99 reconnues
8
plus rapide que le temps réel (étape Parakeet)
38×
moteur précédent, même test
7,6%

Taux d’erreurs de mots par langue

Plus c’est bas, mieux c’est. Chaque langue est un fichier de 5 à 8 minutes composé de 30 phrases FLEURS mises bout à bout, transcrit avec détection automatique de la langue — comme vos fichiers.

Taux d’erreurs de mots par langue
LangueMoteur en productionWER aujourd’huiMoteur précédentAujourd’huiMoteur précédent
anglaisWhisper large-v3-turbo5,4%3,8%
polonaisParakeet-TDT-0.6B-v38,7%7,5%
allemandParakeet-TDT-0.6B-v37,4%8,8%
espagnolParakeet-TDT-0.6B-v33,0%4,5%
françaisParakeet-TDT-0.6B-v34,9%8,1%
italienParakeet-TDT-0.6B-v33,5%13,7%
portugaisParakeet-TDT-0.6B-v34,4%8,3%
russeWhisper large-v3-turbo5,1%6,0%
Moyenne5,3%7,6%

Mesuré le 1 octobre 2026 sur la GPU qui transcrit en production. Là où le moteur précédent semble meilleur (anglais, polonais), l’écart n’a pas tenu sur un échantillon plus grand — voir la mesure sur 80 phrases ci-dessous.

Pourquoi deux moteurs

Aucun modèle ne gagnait dans toutes les langues, alors BriefVox envoie chaque enregistrement au moteur qui a obtenu le meilleur score dans sa langue. Whisper identifie aussi la langue et couvre tout ce qui sort des 25 langues européennes de Parakeet.

MoteurWER moyenVitesse
NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp325,5%37,8× temps réel
OpenAI Whisper large-v3-turboint8, beam 56,3%10,8× temps réel
OpenAI Whisper large-v3int8, beam 10 — previous production setting7,6%4,4× temps réel

Résultats serrés, revérifiés

Trente phrases, c’est environ 700 mots par langue : un point d’écart ne représente que quelques mots. Là où les meilleurs étaient proches (anglais, allemand, polonais, russe), nous avons refait la mesure avec 80 phrases. Allemand et polonais sont à égalité, donc le moteur 3× plus rapide les prend ; l’anglais et le russe restent sur Whisper.

MoteurENDEPLRU
Whisper large-v34,7%——6,1%
Whisper large-v3-turbo4,8%5,5%7,2%4,8%
Parakeet-TDT-0.6B-v35,3%5,4%7,1%6,5%

Méthode

Données

Jeu de test Google FLEURS pour les huit langues de l’interface. Les phrases sont assemblées avec 0,6 s de pause en un long fichier, car les vrais fichiers sont longs : la segmentation et la détection de la parole font partie de la mesure.

Niveau

Chaque phrase est ramenée au même niveau sonore (−23 dBFS) avant l’assemblage, puisque notre chaîne normalise de toute façon le volume avant la reconnaissance.

Métrique

Taux d’erreurs de mots après la même normalisation pour chaque moteur : minuscules, sans ponctuation ni symboles. Les nombres ne sont pas harmonisés (« 25 » contre « vingt-cinq »), ce qui pénalise un peu chaque moteur.

Vitesse

Secondes d’audio par seconde de traitement sur la GPU de production (NVIDIA GTX 1060 6 Go), chargement du modèle exclu.

Ce que ces chiffres ne disent pas

  • FLEURS est de la parole lue distinctement. Les salles bruyantes, les voix qui se chevauchent, l’audio téléphonique et les accents marqués produisent plus d’erreurs — chaque mot se corrige dans l’éditeur.
  • Environ 700 mots par langue : les écarts de moins d’un point restent dans le bruit.
  • Le taux d’erreurs compte les mots, pas l’attribution des intervenants ni l’horodatage, qui viennent d’étapes distinctes d’alignement et de diarisation.
  • Seule la reconnaissance est mesurée. Une tâche complète comprend aussi l’import, l’alignement des mots, l’identification des intervenants et l’enregistrement ; elle dure donc plus longtemps que ne le laisse penser la vitesse.

Ce qui arrive à votre fichier

  1. 1Whisper large-v3-turbo détecte la langue sur plusieurs fenêtres de 30 secondes réparties sur l’enregistrement, pas seulement sur l’introduction.
  2. 2L’enregistrement part vers le moteur le mieux classé pour cette langue ; si Parakeet échoue ou ne connaît pas la langue, Whisper prend le relais.
  3. 3Chaque mot est horodaté par alignement forcé, et pyannote sépare les intervenants.

Reproduisez-le

Les scripts du benchmark téléchargent FLEURS, exécutent chaque moteur et notent le résultat. Voici exactement les commandes derrière le tableau :

python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
    --repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
    --out results/turbo.jsonl
python score.py results/*.jsonl

Essayez-le sur votre propre enregistrement

20 minutes offertes chaque mois, sans carte. Le benchmark qui compte, c’est votre audio.

Commencer gratuitement