Saltar para o conteúdo

Benchmark de precisão

Medimos a nossa precisão. Eis exatamente como.

No benchmark Google FLEURS, a BriefVox comete cerca de 5,3% erros por cada 100 palavras em oito línguas — com o nosso motor anterior eram 7,6%. Abaixo: cada número, como o obtivemos e onde deixa de se aplicar.

erro médio por palavra, 8 línguas
5,3%
línguas medidas; 99 reconhecidas
8
mais rápido do que o tempo real (fase Parakeet)
38×
motor anterior, mesmo teste
7,6%

Taxa de erro por palavra por língua

Quanto mais baixo, melhor. Cada língua é um ficheiro de 5–8 minutos com 30 frases FLEURS unidas, transcrito com deteção automática da língua — tal como os seus ficheiros.

Taxa de erro por palavra por língua
LínguaMotor em produçãoWER hojeMotor anteriorHojeMotor anterior
inglêsWhisper large-v3-turbo5,4%3,8%
polacoParakeet-TDT-0.6B-v38,7%7,5%
alemãoParakeet-TDT-0.6B-v37,4%8,8%
espanholParakeet-TDT-0.6B-v33,0%4,5%
francêsParakeet-TDT-0.6B-v34,9%8,1%
italianoParakeet-TDT-0.6B-v33,5%13,7%
portuguêsParakeet-TDT-0.6B-v34,4%8,3%
russoWhisper large-v3-turbo5,1%6,0%
Média5,3%7,6%

Medido a 1 de outubro de 2026 na GPU que transcreve em produção. Onde o motor anterior parece melhor (inglês, polaco), a vantagem não se manteve numa amostra maior — veja a medição com 80 frases abaixo.

Porquê dois motores

Nenhum modelo ganhou em todas as línguas, por isso a BriefVox envia cada gravação para o motor que teve o melhor resultado na sua língua. O Whisper também identifica a língua e cobre tudo o que fica fora das 25 línguas europeias do Parakeet.

MotorWER médioVelocidade
NVIDIA Parakeet-TDT-0.6B-v3ONNX, fp325,5%37,8× tempo real
OpenAI Whisper large-v3-turboint8, beam 56,3%10,8× tempo real
OpenAI Whisper large-v3int8, beam 10 — previous production setting7,6%4,4× tempo real

Resultados renhidos, verificados de novo

Trinta frases são cerca de 700 palavras por língua, por isso um ponto de diferença são poucas palavras. Onde os melhores estavam próximos (inglês, alemão, polaco, russo), repetimos a medição com 80 frases. Alemão e polaco ficaram empatados, por isso fica com eles o motor 3× mais rápido; inglês e russo continuam no Whisper.

MotorENDEPLRU
Whisper large-v34,7%——6,1%
Whisper large-v3-turbo4,8%5,5%7,2%4,8%
Parakeet-TDT-0.6B-v35,3%5,4%7,1%6,5%

Método

Dados

Conjunto de teste Google FLEURS para as oito línguas da interface. As frases são unidas com pausas de 0,6 s num ficheiro longo, porque os ficheiros reais são longos — a segmentação e a deteção de voz também são medidas.

Nível

Cada frase é levada ao mesmo volume (−23 dBFS) antes de ser unida, uma vez que o nosso processo normaliza o volume antes do reconhecimento.

Métrica

Taxa de erro por palavra após a mesma normalização para cada motor: minúsculas, sem pontuação nem símbolos. Os números não são uniformizados («25» vs. «vinte e cinco»), o que penaliza um pouco todos os motores.

Velocidade

Segundos de áudio por segundo de processamento na GPU de produção (NVIDIA GTX 1060 6 GB), sem contar o carregamento do modelo.

O que estes números não dizem

  • FLEURS é fala lida com clareza. Salas ruidosas, vozes sobrepostas, áudio de telefone e sotaques fortes produzem mais erros — pode corrigir qualquer palavra no editor.
  • Cerca de 700 palavras por língua: diferenças inferiores a um ponto estão dentro do ruído.
  • A taxa de erro conta palavras, não a atribuição de oradores nem as marcas de tempo, que resultam de passos separados de alinhamento e diarização.
  • Mede-se apenas o reconhecimento. Um trabalho completo também envia o ficheiro, alinha as palavras, identifica os oradores e guarda o resultado, por isso demora mais do que a velocidade sugere.

O que acontece ao seu ficheiro

  1. 1O Whisper large-v3-turbo deteta a língua a partir de várias janelas de 30 segundos ao longo da gravação, não só da introdução.
  2. 2A gravação vai para o motor que teve o melhor resultado nessa língua; se o Parakeet falhar ou não conhecer a língua, o Whisper assume.
  3. 3Cada palavra é sincronizada com alinhamento forçado e o pyannote separa os oradores.

Reproduza-o

Os scripts do benchmark descarregam o FLEURS, executam cada motor e avaliam o resultado. Estes são exatamente os comandos por trás da tabela:

python fetch_fleurs.py --out data --per-lang 30
python run_bench.py --engine onnx --model nemo-parakeet-tdt-0.6b-v3 \
    --repo istupakov/parakeet-tdt-0.6b-v3-onnx --kinds long --out results/parakeet.jsonl
python run_bench.py --engine whisperx --model large-v3-turbo --beam 5 --kinds long \
    --out results/turbo.jsonl
python score.py results/*.jsonl

Experimente com a sua própria gravação

20 minutos grátis todos os meses, sem cartão. O benchmark que conta é o do seu áudio.

Começar grátis