El ranker
Cada modelo. Mismo audio. Mismas métricas. Se re-ejecutan en cada cambio de modelo o de precio.
10 transcripciones gratis, hasta 2 horas al registrarte — sin tarjeta.
35
Modelos Evaluados
1127
Total de Benchmarks
11
Idiomas Evaluados
28 jul 2026
Última Actualización
01 · Líder
Ink-Whisper
Cartesia
84.6
Puntuación
WER
17.20%
Latencia
773ms
Costo
$0.0022/min
02 · Segundo
Whisper Large V3 Turbo
Groq
81.3
Puntuación
WER
14.31%
Latencia
3.4s
Costo
$0.0007/min
03 · Tercero
GPT-4o Mini Transcribe
OpenAI
81.1
Puntuación
WER
13.58%
Latencia
2.0s
Costo
$0.003/min
01
Ink-Whisper
84.6
17.20% WER
773ms
$0.0022/min
02
Whisper Large V3 Turbo
81.3
14.31% WER
3.4s
$0.0007/min
03
GPT-4o Mini Transcribe
81.1
13.58% WER
2.0s
$0.003/min
04
Voxtral Mini Transcribe
80.7
12.70% WER
2.3s
$0.003/min
05
Whisper Large V3
79.9
14.41% WER
3.1s
$0.0019/min
06
Scribe v2
78.2
9.15% WER
3.1s
$0.004/min
07
Nova-2 Voicemail
76.7
17.51% WER
954ms
$0.0058/min
08
Nova-2
76.2
16.54% WER
1.3s
$0.0058/min
09
Nova-2 Phone Call
75.7
16.38% WER
1.5s
$0.0058/min
10
Azure Speech
74.4
15.34% WER
2.0s
$0.006/min
11
GPT-4o Transcribe
74.0
14.76% WER
2.2s
$0.006/min
12
Soniox STT (Async)
73.7
8.73% WER
6.2s
$0.0017/min
13
Nova-2 Meeting
71.3
16.74% WER
2.9s
$0.0058/min
14
Nova-3
71.1
20.98% WER
1.0s
$0.0077/min
15
Nova-2 Finance
69.6
18.92% WER
3.1s
$0.0058/min
16
Whisper Large V3
69.3
17.67% WER
3.3s
$0.006/min
17
Qwen3 ASR Flash
69.1
12.27% WER
6.9s
$0.0021/min
18
Whisper 1 (API)
69.0
17.63% WER
3.4s
$0.006/min
19
Nova-2 Conversational AI
67.6
18.23% WER
3.9s
$0.0058/min
20
Universal-3.5 Pro
67.4
17.44% WER
5.6s
$0.0035/min
21
Base
65.2
25.04% WER
772ms
$0.0145/min
22
Enhanced
63.8
24.86% WER
1.3s
$0.0165/min
23
Speechmatics Standard
60.9
14.69% WER
7.3s
$0.005/min
24
Rev AI Reverb
54.9
18.18% WER
13.7s
$0.003/min
25
Gladia Solaria-3
52.2
9.80% WER
7.6s
$0.0101/min
26
Amazon Transcribe
51.5
13.02% WER
12.4s
$0.006/min
27
GPT-4o Transcribe Diarize
50.7
14.61% WER
15.2s
$0.006/min
28
Speechmatics Enhanced
47.3
12.30% WER
12.1s
$0.0083/min
29
Chirp 3
45.0
9.95% WER
11.0s
$0.0107/min
30
Amazon Transcribe Medical
42.5
14.92% WER
11.4s
$0.075/min
31
Google Telephony
39.9
20.24% WER
21.0s
$0.016/min
32
Google Latest (Long)
38.7
22.55% WER
13.2s
$0.0107/min
33
Google Default
32.7
34.65% WER
13.4s
$0.016/min
34
Google Command & Search
32.4
35.22% WER
12.7s
$0.016/min
35
Google Latest (Short)
21.1
57.82% WER
11.3s
$0.016/min
Cambio de Código
Scribe v2
ElevenLabs
n=2 · muy pocos para separar
Conversacional
Chirp 3
Google Cloud
n=2 · muy pocos para separar
Finanzas
Universal-3.5 Pro
AssemblyAI
n=2 · muy pocos para separar
General
Amazon Transcribe Medical
Amazon Web Services
dentro del margen · 1.28%–9.99%
Legal
Azure Speech
Microsoft Azure
n=2 · muy pocos para separar
Médico
Soniox STT (Async)
Soniox
n=2 · muy pocos para separar
Ambiente Ruidoso
Nova-3
Deepgram
dentro del margen · 6.82%–35.00%
Técnico
Nova-3
Deepgram
n=2 · muy pocos para separar
50%
Precisión
WER + CER frente a transcripciones de referencia
30%
Velocidad
Latencia mediana de extremo a extremo
20%
Eficiencia de costo
Precio por minuto de audio
01
Set dorado
Audio de prueba curado con transcripciones de referencia humanas verificadas en varios idiomas, acentos y niveles de ruido. Algunos corpus públicos de habla leída (LibriSpeech, FLEURS, Common Voice) pueden aparecer en los datos de entrenamiento de los modelos, lo que puede favorecer a los modelos entrenados con ellos; lo contrarrestamos puntuando también con audio de dominios — jurídico, financiero y conversacional — que es poco probable que esté en los conjuntos de entrenamiento habituales.
02
Mismo audio, ajustes recomendados por el proveedor
Cada modelo procesa el mismo set de prueba — sin clips seleccionados a conveniencia. Nuestra regla para las llamadas: cada modelo usa los ajustes recomendados por su proveedor — la configuración que usaría un usuario real — y no una llamada de mínimo común denominador que penalice a un modelo por las buenas prácticas de su proveedor (p. ej., los modelos gpt-4o de OpenAI usan segmentación por VAD en el servidor).
03
Por eventos y automatizado
Los benchmarks se re-ejecutan automáticamente en cada cambio de modelo o de precio, sin sesgo humano. Cada proveedor recibe el mismo audio de prueba.
04
Puntuación
Puntuación compuesta ponderada: 50% precisión (WER), 30% velocidad, 20% eficiencia de costo. Los líderes por categoría muestran un intervalo de confianza; cuando hay muy pocos clips para separar modelos, lo indicamos en vez de coronar un ganador.
Fuentes y licencias del corpus
El conjunto de referencia se construye con audio de licencia abierta. LibriSpeech y FLEURS son CC BY 4.0 y requieren atribución; el resto se acredita por transparencia.
LibriSpeech (test-clean) — CC BY 4.0
Mozilla Common Voice — CC0 1.0
Bangor Miami (TalkBank) — GPLv3
Spoken Wikipedia CS Corpus — CC BY-SA 3.0
U.S. government recordings (SCOTUS, NIH/CDC) — Public domain
Original recordings — OpenTranscription
WER
Tasa de Error de Palabras
Porcentaje de palabras transcritas incorrectamente (menor es mejor)
CER
Tasa de Error de Caracteres
Porcentaje de caracteres transcritos incorrectamente (menor es mejor)
MER
Tasa de Error de Coincidencia
Proporción de errores respecto a la longitud total de alineación (menor es mejor)
WIL
Información de Palabras Perdida
Fracción de información de palabras perdida en la transcripción (menor es mejor)
Un solo endpoint, todos los proveedores. Fija el líder o deja que enrutemos automáticamente al mejor modelo según tu presupuesto de precisión y latencia.