El ranker · benchmark 07 / 2026
Cada modelo. Mismo audio. Mismas métricas. Se re-ejecutan en cada cambio de modelo o de precio.
10 transcripciones gratis, hasta 2 horas al registrarte — sin tarjeta.
34
Modelos Evaluados
1,091
Total de Benchmarks
11
Idiomas Evaluados
17 jul 2026
Última Actualización
01 · Líder
Ink-Whisper
Cartesia
82.5
score
WER
22.01%
Latency
695ms
Cost
$0.0022/min
02 · Segundo
Whisper Large V3 Turbo
Groq
81.3
score
WER
14.31%
Latency
3.4s
Cost
$0.0007/min
03 · Tercero
GPT-4o Mini Transcribe
OpenAI
81.1
score
WER
13.58%
Latency
2.0s
Cost
$0.003/min
01
Ink-Whisper
82.5
22.01% WER
695ms
$0.0022/min
02
Whisper Large V3 Turbo
81.3
14.31% WER
3.4s
$0.0007/min
03
GPT-4o Mini Transcribe
81.1
13.58% WER
2.0s
$0.003/min
04
Voxtral Mini Transcribe
80.7
12.70% WER
2.3s
$0.003/min
05
Whisper Large V3
79.9
14.41% WER
3.1s
$0.0019/min
06
Scribe v2
78.2
9.15% WER
3.1s
$0.004/min
07
Nova-2 Voicemail
76.7
17.51% WER
954ms
$0.0058/min
08
Nova-2
76.2
16.54% WER
1.3s
$0.0058/min
09
Nova-2 Phone Call
75.7
16.38% WER
1.5s
$0.0058/min
10
GPT-4o Transcribe
74.0
14.76% WER
2.2s
$0.006/min
11
Nova-2 Meeting
71.3
16.74% WER
2.9s
$0.0058/min
12
Nova-3
71.1
20.98% WER
1.0s
$0.0077/min
13
Nova-2 Finance
69.6
18.92% WER
3.1s
$0.0058/min
14
Whisper Large V3
69.3
17.67% WER
3.3s
$0.006/min
15
Qwen3 ASR Flash
69.1
12.27% WER
6.9s
$0.0021/min
16
Whisper 1 (API)
69.0
17.63% WER
3.4s
$0.006/min
17
Universal-3 Pro
67.7
17.50% WER
5.5s
$0.0035/min
18
Nova-2 Conversational AI
67.6
18.23% WER
3.9s
$0.0058/min
19
Base
65.2
25.04% WER
772ms
$0.0145/min
20
AssemblyAI Best
61.9
13.31% WER
3.8s
$0.09/min
21
Enhanced
61.7
25.24% WER
1.9s
$0.0165/min
22
Speechmatics Standard
60.9
14.69% WER
7.3s
$0.005/min
23
Rev AI Reverb
54.9
18.18% WER
13.7s
$0.003/min
24
Gladia Solaria-3
52.2
9.80% WER
7.6s
$0.0101/min
25
Amazon Transcribe
51.5
13.02% WER
12.4s
$0.006/min
26
GPT-4o Transcribe Diarize
50.7
14.61% WER
15.2s
$0.006/min
27
Speechmatics Enhanced
49.6
15.60% WER
8.7s
$0.0083/min
28
Chirp 3
45.0
9.95% WER
11.0s
$0.0107/min
29
Amazon Transcribe Medical
42.5
14.92% WER
11.4s
$0.075/min
30
Google Telephony
39.9
20.24% WER
21.0s
$0.016/min
31
Google Latest (Long)
38.7
22.55% WER
13.2s
$0.0107/min
32
Google Default
32.7
34.65% WER
13.4s
$0.016/min
33
Google Command & Search
32.4
35.22% WER
12.7s
$0.016/min
34
Google Latest (Short)
21.1
57.82% WER
11.3s
$0.016/min
WER vs. costo y velocidad
sin un único ganador
Cambio de Código
Scribe v2
ElevenLabs
n=2 · muy pocos para separar
Conversacional
Chirp 3
Google Cloud
n=2 · muy pocos para separar
Finanzas
Universal-3 Pro
AssemblyAI
n=2 · muy pocos para separar
General
Amazon Transcribe Medical
Amazon Web Services
dentro del margen · 1.31%–9.90%
Legal
Universal-3 Pro
AssemblyAI
n=2 · muy pocos para separar
Médico
Whisper Large V3 Turbo
Groq
n=2 · muy pocos para separar
Ambiente Ruidoso
Nova-3
Deepgram
dentro del margen · 5.00%–35.00%
Técnico
Nova-3
Deepgram
n=2 · muy pocos para separar
compuesto ponderado
50%
Precisión
WER + CER frente a transcripciones de referencia
30%
Velocidad
Latencia mediana de extremo a extremo
20%
Eficiencia de costo
Precio por minuto de audio
metodología abierta
01
Set dorado
Audio de prueba curado con transcripciones de referencia humanas verificadas en varios idiomas, acentos y niveles de ruido. Algunos corpus públicos de habla leída (LibriSpeech, FLEURS, Common Voice) pueden aparecer en los datos de entrenamiento de los modelos, lo que puede favorecer a los modelos entrenados con ellos; lo contrarrestamos puntuando también con audio de dominios — jurídico, financiero y conversacional — que es poco probable que esté en los conjuntos de entrenamiento habituales.
02
Mismo audio, ajustes recomendados por el proveedor
Cada modelo procesa el mismo set de prueba — sin clips seleccionados a conveniencia. Nuestra regla para las llamadas: cada modelo usa los ajustes recomendados por su proveedor — la configuración que usaría un usuario real — y no una llamada de mínimo común denominador que penalice a un modelo por las buenas prácticas de su proveedor (p. ej., los modelos gpt-4o de OpenAI usan segmentación por VAD en el servidor).
03
Por eventos y automatizado
Los benchmarks se re-ejecutan automáticamente en cada cambio de modelo o de precio, sin sesgo humano. Cada proveedor recibe el mismo audio de prueba.
04
Puntuación
Puntuación compuesta ponderada: 50% precisión (WER), 30% velocidad, 20% eficiencia de costo. Los líderes por categoría muestran un intervalo de confianza; cuando hay muy pocos clips para separar modelos, lo indicamos en vez de coronar un ganador.
Fuentes y licencias del corpus
El conjunto de referencia se construye con audio de licencia abierta. LibriSpeech y FLEURS son CC BY 4.0 y requieren atribución; el resto se acredita por transparencia.
LibriSpeech (test-clean) — CC BY 4.0
Mozilla Common Voice — CC0 1.0
Bangor Miami (TalkBank) — GPLv3
Spoken Wikipedia CS Corpus — CC BY-SA 3.0
U.S. government recordings (SCOTUS, NIH/CDC) — Public domain
Original recordings — OpenTranscription
cómo se cuentan los errores
WER
Tasa de Error de Palabras
Porcentaje de palabras transcritas incorrectamente (menor es mejor)
CER
Tasa de Error de Caracteres
Porcentaje de caracteres transcritos incorrectamente (menor es mejor)
MER
Tasa de Error de Coincidencia
Proporción de errores respecto a la longitud total de alineación (menor es mejor)
WIL
Información de Palabras Perdida
Fracción de información de palabras perdida en la transcripción (menor es mejor)
Un solo endpoint, todos los proveedores. Fija el líder o deja que enrutemos automáticamente al mejor modelo según tu presupuesto de precisión y latencia.