Benchmark de precisão
Medimos a nossa precisão. Eis exatamente como.
No benchmark Google FLEURS, a BriefVox comete cerca de 5,3% erros por cada 100 palavras em oito línguas — com o nosso motor anterior eram 7,6%. Abaixo: cada número, como o obtivemos e onde deixa de se aplicar.
- erro médio por palavra, 8 línguas
- 5,3%
- línguas medidas; 99 reconhecidas
- 8
- mais rápido do que o tempo real (fase Parakeet)
- 38×
- motor anterior, mesmo teste
- 7,6%
Taxa de erro por palavra por língua
Quanto mais baixo, melhor. Cada língua é um ficheiro de 5–8 minutos com 30 frases FLEURS unidas, transcrito com deteção automática da língua — tal como os seus ficheiros.
| Língua | Motor em produção | WER hoje | Motor anterior | HojeMotor anterior |
|---|---|---|---|---|
| inglês | Whisper large-v3-turbo | 5,4% | 3,8% | |
| polaco | Parakeet-TDT-0.6B-v3 | 8,7% | 7,5% | |
| alemão | Parakeet-TDT-0.6B-v3 | 7,4% | 8,8% | |
| espanhol | Parakeet-TDT-0.6B-v3 | 3,0% | 4,5% | |
| francês | Parakeet-TDT-0.6B-v3 | 4,9% | 8,1% | |
| italiano | Parakeet-TDT-0.6B-v3 | 3,5% | 13,7% | |
| português | Parakeet-TDT-0.6B-v3 | 4,4% | 8,3% | |
| russo | Whisper large-v3-turbo | 5,1% | 6,0% | |
| Média | 5,3% | 7,6% |
Medido a 1 de outubro de 2026 na GPU que transcreve em produção. Onde o motor anterior parece melhor (inglês, polaco), a vantagem não se manteve numa amostra maior — veja a medição com 80 frases abaixo.
Porquê dois motores
Nenhum modelo ganhou em todas as línguas, por isso a BriefVox envia cada gravação para o motor que teve o melhor resultado na sua língua. O Whisper também identifica a língua e cobre tudo o que fica fora das 25 línguas europeias do Parakeet.
| Motor | WER médio | Velocidade |
|---|---|---|
| NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp32 | 5,5% | 37,8× tempo real |
| OpenAI Whisper large-v3-turboint8, beam 5 | 6,3% | 10,8× tempo real |
| OpenAI Whisper large-v3int8, beam 10 — previous production setting | 7,6% | 4,4× tempo real |
Resultados renhidos, verificados de novo
Trinta frases são cerca de 700 palavras por língua, por isso um ponto de diferença são poucas palavras. Onde os melhores estavam próximos (inglês, alemão, polaco, russo), repetimos a medição com 80 frases. Alemão e polaco ficaram empatados, por isso fica com eles o motor 3× mais rápido; inglês e russo continuam no Whisper.
| Motor | EN | DE | PL | RU |
|---|---|---|---|---|
| Whisper large-v3 | 4,7% | — | — | 6,1% |
| Whisper large-v3-turbo | 4,8% | 5,5% | 7,2% | 4,8% |
| Parakeet-TDT-0.6B-v3 | 5,3% | 5,4% | 7,1% | 6,5% |
Método
Dados
Conjunto de teste Google FLEURS para as oito línguas da interface. As frases são unidas com pausas de 0,6 s num ficheiro longo, porque os ficheiros reais são longos — a segmentação e a deteção de voz também são medidas.
Nível
Cada frase é levada ao mesmo volume (−23 dBFS) antes de ser unida, uma vez que o nosso processo normaliza o volume antes do reconhecimento.
Métrica
Taxa de erro por palavra após a mesma normalização para cada motor: minúsculas, sem pontuação nem símbolos. Os números não são uniformizados («25» vs. «vinte e cinco»), o que penaliza um pouco todos os motores.
Velocidade
Segundos de áudio por segundo de processamento na GPU de produção (NVIDIA GTX 1060 6 GB), sem contar o carregamento do modelo.
O que estes números não dizem
- FLEURS é fala lida com clareza. Salas ruidosas, vozes sobrepostas, áudio de telefone e sotaques fortes produzem mais erros — pode corrigir qualquer palavra no editor.
- Cerca de 700 palavras por língua: diferenças inferiores a um ponto estão dentro do ruído.
- A taxa de erro conta palavras, não a atribuição de oradores nem as marcas de tempo, que resultam de passos separados de alinhamento e diarização.
- Mede-se apenas o reconhecimento. Um trabalho completo também envia o ficheiro, alinha as palavras, identifica os oradores e guarda o resultado, por isso demora mais do que a velocidade sugere.
O que acontece ao seu ficheiro
- 1O Whisper large-v3-turbo deteta a língua a partir de várias janelas de 30 segundos ao longo da gravação, não só da introdução.
- 2A gravação vai para o motor que teve o melhor resultado nessa língua; se o Parakeet falhar ou não conhecer a língua, o Whisper assume.
- 3Cada palavra é sincronizada com alinhamento forçado e o pyannote separa os oradores.
Reproduza-o
Os scripts do benchmark descarregam o FLEURS, executam cada motor e avaliam o resultado. Estes são exatamente os comandos por trás da tabela:
python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
--repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
--out results/turbo.jsonl
python score.py results/*.jsonlExperimente com a sua própria gravação
20 minutos grátis todos os meses, sem cartão. O benchmark que conta é o do seu áudio.
Começar grátis