Benchmark de precisión
Medimos nuestra precisión. Así es exactamente como lo hicimos.
En el benchmark Google FLEURS, BriefVox comete unos 5,3% errores por cada 100 palabras en ocho idiomas; con nuestro motor anterior eran 7,6%. Abajo: cada cifra, cómo la obtuvimos y dónde deja de aplicarse.
- error medio por palabra, 8 idiomas
- 5,3%
- idiomas medidos; 99 reconocidos
- 8
- más rápido que el tiempo real (fase Parakeet)
- 38×
- motor anterior, misma prueba
- 7,6%
Tasa de error por palabra según el idioma
Cuanto más baja, mejor. Cada idioma es un archivo de 5–8 minutos con 30 frases de FLEURS unidas, transcrito con detección automática de idioma, igual que tus archivos.
| Idioma | Motor en producción | WER hoy | Motor anterior | HoyMotor anterior |
|---|---|---|---|---|
| inglés | Whisper large-v3-turbo | 5,4% | 3,8% | |
| polaco | Parakeet-TDT-0.6B-v3 | 8,7% | 7,5% | |
| alemán | Parakeet-TDT-0.6B-v3 | 7,4% | 8,8% | |
| español | Parakeet-TDT-0.6B-v3 | 3,0% | 4,5% | |
| francés | Parakeet-TDT-0.6B-v3 | 4,9% | 8,1% | |
| italiano | Parakeet-TDT-0.6B-v3 | 3,5% | 13,7% | |
| portugués | Parakeet-TDT-0.6B-v3 | 4,4% | 8,3% | |
| ruso | Whisper large-v3-turbo | 5,1% | 6,0% | |
| Media | 5,3% | 7,6% |
Medido el 1 de octubre de 2026 en la GPU que transcribe en producción. Donde el motor anterior parece mejor (inglés, polaco), la ventaja no se mantuvo con una muestra mayor: mira la repetición con 80 frases más abajo.
Por qué dos motores
Ningún modelo ganó en todos los idiomas, así que BriefVox envía cada grabación al motor que mejor resultado dio en su idioma. Whisper además identifica el idioma y cubre todo lo que queda fuera de los 25 idiomas europeos de Parakeet.
| Motor | WER medio | Velocidad |
|---|---|---|
| NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp32 | 5,5% | 37,8× tiempo real |
| OpenAI Whisper large-v3-turboint8, beam 5 | 6,3% | 10,8× tiempo real |
| OpenAI Whisper large-v3int8, beam 10 — previous production setting | 7,6% | 4,4× tiempo real |
Resultados ajustados, revisados
Treinta frases son unas 700 palabras por idioma, así que un punto de diferencia son pocas palabras. Donde los primeros estaban cerca (inglés, alemán, polaco, ruso) repetimos la medición con 80 frases. Alemán y polaco quedaron empatados, así que se los queda el motor 3× más rápido; inglés y ruso siguen con Whisper.
| Motor | EN | DE | PL | RU |
|---|---|---|---|---|
| Whisper large-v3 | 4,7% | — | — | 6,1% |
| Whisper large-v3-turbo | 4,8% | 5,5% | 7,2% | 4,8% |
| Parakeet-TDT-0.6B-v3 | 5,3% | 5,4% | 7,1% | 6,5% |
Método
Datos
Conjunto de prueba de Google FLEURS para los ocho idiomas de la interfaz. Las frases se unen con pausas de 0,6 s en un archivo largo, porque los archivos reales son largos: la segmentación y la detección de voz también se miden.
Nivel
Cada frase se lleva a la misma sonoridad (−23 dBFS) antes de unirla, ya que nuestro proceso normaliza la sonoridad antes del reconocimiento.
Métrica
Tasa de error por palabra tras la misma normalización para cada motor: minúsculas, sin puntuación ni símbolos. Los números no se unifican («25» frente a «veinticinco»), lo que penaliza un poco a todos los motores.
Velocidad
Segundos de audio por segundo de proceso en la GPU de producción (NVIDIA GTX 1060 6 GB), sin contar la carga del modelo.
Lo que estas cifras no dicen
- FLEURS es habla leída con claridad. Las salas ruidosas, las voces solapadas, el audio de teléfono y los acentos marcados producen más errores; puedes corregir cualquier palabra en el editor.
- Unas 700 palabras por idioma: las diferencias de menos de un punto están dentro del ruido.
- La tasa de error cuenta palabras, no la atribución de hablantes ni las marcas de tiempo, que salen de pasos aparte de alineación y diarización.
- Se mide solo el reconocimiento. Un trabajo completo también sube el archivo, alinea palabras, identifica hablantes y guarda el resultado, así que tarda más de lo que indica la velocidad.
Qué pasa con tu archivo
- 1Whisper large-v3-turbo detecta el idioma a partir de varias ventanas de 30 segundos repartidas por la grabación, no solo de la introducción.
- 2La grabación va al motor que mejor resultado dio en ese idioma; si Parakeet falla o no conoce el idioma, se encarga Whisper.
- 3Cada palabra se sincroniza con alineación forzada y pyannote separa a los hablantes.
Reprodúcelo
Los scripts del benchmark descargan FLEURS, ejecutan cada motor y puntúan el resultado. Estos son exactamente los comandos detrás de la tabla:
python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
--repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
--out results/turbo.jsonl
python score.py results/*.jsonlPruébalo con tu propia grabación
20 minutos gratis cada mes, sin tarjeta. El benchmark que importa es el de tu audio.
Empezar gratis