El ranker · benchmark 07 / 2026

Benchmarks objetivos de transcripción.

Cada modelo. Mismo audio. Mismas métricas. Se re-ejecutan en cada cambio de modelo o de precio.

Empezar gratisAbrir playground

10 transcripciones gratis, hasta 2 horas al registrarte — sin tarjeta.

34

Modelos Evaluados

1,091

Total de Benchmarks

11

Idiomas Evaluados

17 jul 2026

Última Actualización

01 · Líder

Ink-Whisper

Cartesia

82.5

score

WER

22.01%

Latency

695ms

Cost

$0.0022/min

02 · Segundo

Whisper Large V3 Turbo

Groq

81.3

score

WER

14.31%

Latency

3.4s

Cost

$0.0007/min

03 · Tercero

GPT-4o Mini Transcribe

OpenAI

81.1

score

WER

13.58%

Latency

2.0s

Cost

$0.003/min

#ModeloPuntuación GeneralWERCERLatenciaCostoBenchmarks

01

Ink-Whisper

Cartesia

82.5

22.01%

11.58%

695ms

$0.0022/min

35

02

Whisper Large V3 Turbo

Groq

81.3

14.31%

10.63%

3.4s

$0.0007/min

33

03

GPT-4o Mini Transcribe

OpenAI

81.1

13.58%

9.32%

2.0s

$0.003/min

35

04

Voxtral Mini Transcribe

Mistral (Voxtral)

80.7

12.70%

7.97%

2.3s

$0.003/min

30

05

Whisper Large V3

Groq

79.9

14.41%

11.20%

3.1s

$0.0019/min

33

06

Scribe v2

ElevenLabs

78.2

9.15%

7.19%

3.1s

$0.004/min

35

07

Nova-2 Voicemail

Deepgram

76.7

17.51%

12.36%

954ms

$0.0058/min

25

08

Nova-2

Deepgram

76.2

16.54%

11.93%

1.3s

$0.0058/min

34

09

Nova-2 Phone Call

Deepgram

75.7

16.38%

12.42%

1.5s

$0.0058/min

25

10

GPT-4o Transcribe

OpenAI

74.0

14.76%

11.60%

2.2s

$0.006/min

35

11

Nova-2 Meeting

Deepgram

71.3

16.74%

11.73%

2.9s

$0.0058/min

25

12

Nova-3

Deepgram

71.1

20.98%

11.48%

1.0s

$0.0077/min

35

13

Nova-2 Finance

Deepgram

69.6

18.92%

13.09%

3.1s

$0.0058/min

25

14

Whisper Large V3

OpenAI

69.3

17.67%

13.06%

3.3s

$0.006/min

35

15

Qwen3 ASR Flash

Alibaba (Qwen)

69.1

12.27%

7.39%

6.9s

$0.0021/min

35

16

Whisper 1 (API)

OpenAI

69.0

17.63%

13.03%

3.4s

$0.006/min

35

17

Universal-3 Pro

AssemblyAI

67.7

17.50%

10.42%

5.5s

$0.0035/min

35

18

Nova-2 Conversational AI

Deepgram

67.6

18.23%

13.27%

3.9s

$0.0058/min

25

19

Base

Deepgram

65.2

25.04%

18.09%

772ms

$0.0145/min

34

20

AssemblyAI Best

AssemblyAI

61.9

13.31%

9.04%

3.8s

$0.09/min

35

21

Enhanced

Deepgram

61.7

25.24%

15.53%

1.9s

$0.0165/min

31

22

Speechmatics Standard

Speechmatics

60.9

14.69%

9.80%

7.3s

$0.005/min

35

23

Rev AI Reverb

Rev AI

54.9

18.18%

13.46%

13.7s

$0.003/min

35

24

Gladia Solaria-3

Gladia

52.2

9.80%

5.76%

7.6s

$0.0101/min

20

25

Amazon Transcribe

Amazon Web Services

51.5

13.02%

9.17%

12.4s

$0.006/min

35

26

GPT-4o Transcribe Diarize

OpenAI

50.7

14.61%

9.97%

15.2s

$0.006/min

33

27

Speechmatics Enhanced

Speechmatics

49.6

15.60%

8.63%

8.7s

$0.0083/min

34

28

Chirp 3

Google Cloud

45.0

9.95%

5.81%

11.0s

$0.0107/min

34

29

Amazon Transcribe Medical

Amazon Web Services

42.5

14.92%

9.67%

11.4s

$0.075/min

25

30

Google Telephony

Google Cloud

39.9

20.24%

12.59%

21.0s

$0.016/min

32

31

Google Latest (Long)

Google Cloud

38.7

22.55%

13.81%

13.2s

$0.0107/min

34

32

Google Default

Google Cloud

32.7

34.65%

25.66%

13.4s

$0.016/min

35

33

Google Command & Search

Google Cloud

32.4

35.22%

26.46%

12.7s

$0.016/min

35

34

Google Latest (Short)

Google Cloud

21.1

57.82%

52.44%

11.3s

$0.016/min

34

01

Ink-Whisper

82.5

22.01% WER

695ms

$0.0022/min

02

Whisper Large V3 Turbo

81.3

14.31% WER

3.4s

$0.0007/min

03

GPT-4o Mini Transcribe

81.1

13.58% WER

2.0s

$0.003/min

04

Voxtral Mini Transcribe

80.7

12.70% WER

2.3s

$0.003/min

05

Whisper Large V3

79.9

14.41% WER

3.1s

$0.0019/min

06

Scribe v2

78.2

9.15% WER

3.1s

$0.004/min

07

Nova-2 Voicemail

76.7

17.51% WER

954ms

$0.0058/min

08

Nova-2

76.2

16.54% WER

1.3s

$0.0058/min

09

Nova-2 Phone Call

75.7

16.38% WER

1.5s

$0.0058/min

10

GPT-4o Transcribe

74.0

14.76% WER

2.2s

$0.006/min

11

Nova-2 Meeting

71.3

16.74% WER

2.9s

$0.0058/min

12

Nova-3

71.1

20.98% WER

1.0s

$0.0077/min

13

Nova-2 Finance

69.6

18.92% WER

3.1s

$0.0058/min

14

Whisper Large V3

69.3

17.67% WER

3.3s

$0.006/min

15

Qwen3 ASR Flash

69.1

12.27% WER

6.9s

$0.0021/min

16

Whisper 1 (API)

69.0

17.63% WER

3.4s

$0.006/min

17

Universal-3 Pro

67.7

17.50% WER

5.5s

$0.0035/min

18

Nova-2 Conversational AI

67.6

18.23% WER

3.9s

$0.0058/min

19

Base

65.2

25.04% WER

772ms

$0.0145/min

20

AssemblyAI Best

61.9

13.31% WER

3.8s

$0.09/min

21

Enhanced

61.7

25.24% WER

1.9s

$0.0165/min

22

Speechmatics Standard

60.9

14.69% WER

7.3s

$0.005/min

23

Rev AI Reverb

54.9

18.18% WER

13.7s

$0.003/min

24

Gladia Solaria-3

52.2

9.80% WER

7.6s

$0.0101/min

25

Amazon Transcribe

51.5

13.02% WER

12.4s

$0.006/min

26

GPT-4o Transcribe Diarize

50.7

14.61% WER

15.2s

$0.006/min

27

Speechmatics Enhanced

49.6

15.60% WER

8.7s

$0.0083/min

28

Chirp 3

45.0

9.95% WER

11.0s

$0.0107/min

29

Amazon Transcribe Medical

42.5

14.92% WER

11.4s

$0.075/min

30

Google Telephony

39.9

20.24% WER

21.0s

$0.016/min

31

Google Latest (Long)

38.7

22.55% WER

13.2s

$0.0107/min

32

Google Default

32.7

34.65% WER

13.4s

$0.016/min

33

Google Command & Search

32.4

35.22% WER

12.7s

$0.016/min

34

Google Latest (Short)

21.1

57.82% WER

11.3s

$0.016/min

Compensaciones de precisión

WER vs. costo y velocidad

Líderes por categoría

sin un único ganador

Cambio de Código

Scribe v2

ElevenLabs

14.64% WER

n=2 · muy pocos para separar

Conversacional

Chirp 3

Google Cloud

4.68% WER

n=2 · muy pocos para separar

Finanzas

Universal-3 Pro

AssemblyAI

5.63% WER

n=2 · muy pocos para separar

General

Amazon Transcribe Medical

Amazon Web Services

4.70% WER

dentro del margen · 1.31%–9.90%

Legal

Universal-3 Pro

AssemblyAI

1.79% WER

n=2 · muy pocos para separar

Médico

Whisper Large V3 Turbo

Groq

1.78% WER

n=2 · muy pocos para separar

Ambiente Ruidoso

Nova-3

Deepgram

21.82% WER

dentro del margen · 5.00%–35.00%

Técnico

Nova-3

Deepgram

2.82% WER

n=2 · muy pocos para separar

Cómo se construye la puntuación

compuesto ponderado

50%

Precisión

WER + CER frente a transcripciones de referencia

30%

Velocidad

Latencia mediana de extremo a extremo

20%

Eficiencia de costo

Precio por minuto de audio

Cómo Evaluamos

metodología abierta

01

Set dorado

Audio de prueba curado con transcripciones de referencia humanas verificadas en varios idiomas, acentos y niveles de ruido. Algunos corpus públicos de habla leída (LibriSpeech, FLEURS, Common Voice) pueden aparecer en los datos de entrenamiento de los modelos, lo que puede favorecer a los modelos entrenados con ellos; lo contrarrestamos puntuando también con audio de dominios — jurídico, financiero y conversacional — que es poco probable que esté en los conjuntos de entrenamiento habituales.

02

Mismo audio, ajustes recomendados por el proveedor

Cada modelo procesa el mismo set de prueba — sin clips seleccionados a conveniencia. Nuestra regla para las llamadas: cada modelo usa los ajustes recomendados por su proveedor — la configuración que usaría un usuario real — y no una llamada de mínimo común denominador que penalice a un modelo por las buenas prácticas de su proveedor (p. ej., los modelos gpt-4o de OpenAI usan segmentación por VAD en el servidor).

03

Por eventos y automatizado

Los benchmarks se re-ejecutan automáticamente en cada cambio de modelo o de precio, sin sesgo humano. Cada proveedor recibe el mismo audio de prueba.

04

Puntuación

Puntuación compuesta ponderada: 50% precisión (WER), 30% velocidad, 20% eficiencia de costo. Los líderes por categoría muestran un intervalo de confianza; cuando hay muy pocos clips para separar modelos, lo indicamos en vez de coronar un ganador.

Fuentes y licencias del corpus

El conjunto de referencia se construye con audio de licencia abierta. LibriSpeech y FLEURS son CC BY 4.0 y requieren atribución; el resto se acredita por transparencia.

LibriSpeech (test-clean) — CC BY 4.0

FLEURS — CC BY 4.0

Mozilla Common Voice — CC0 1.0

Earnings-21 — CC BY-SA 4.0

Bangor Miami (TalkBank) — GPLv3

Spoken Wikipedia CS Corpus — CC BY-SA 3.0

U.S. government recordings (SCOTUS, NIH/CDC) — Public domain

Original recordings — OpenTranscription

Métricas de evaluación

cómo se cuentan los errores

WER

Tasa de Error de Palabras

(Incorrectas + Adicionales + Omitidas) ÷ Total de palabras dichas

Porcentaje de palabras transcritas incorrectamente (menor es mejor)

CER

Tasa de Error de Caracteres

(Incorrectos + Adicionales + Omitidos) ÷ Total de caracteres dichos

Porcentaje de caracteres transcritos incorrectamente (menor es mejor)

MER

Tasa de Error de Coincidencia

(Incorrectas + Adicionales + Omitidas) ÷ (Correctas + Incorrectas + Adicionales + Omitidas)

Proporción de errores respecto a la longitud total de alineación (menor es mejor)

WIL

Información de Palabras Perdida

1 − (Correctas ÷ Palabras dichas × Correctas ÷ Palabras predichas)

Fracción de información de palabras perdida en la transcripción (menor es mejor)

Enruta al modelo que gane.

Un solo endpoint, todos los proveedores. Fija el líder o deja que enrutemos automáticamente al mejor modelo según tu presupuesto de precisión y latencia.

Comienza gratisLeer la especificación ↗