OpenTranscription
OpenTranscription
RankerModelosPlayground
OpenTranscription
OpenTranscription

Una API para cada modelo de voz a texto que vale la pena. Compáralos con tu audio, enruta al mejor, paga por segundo.

Estado de la plataforma

Producto

ClasificadorModelosTranscripcionesPlaygroundBlog

Desarrolladores

DocumentaciónConfiabilidadVersionado APIEstado

Legal

Política de PrivacidadTérminos de ServicioSoporte
© 2026 OpenTranscription

Clasificador en tiempo real

Transcripción en streaming, clasificada.

Todos los modelos en tiempo real. El mismo audio. Puntuados en capacidad de respuesta, estabilidad y precisión — los ejes que importan cuando las palabras aparecen mientras hablas.

Empezar gratisAbrir playground

10 transcripciones gratis, hasta 2 horas al registrarte — sin tarjeta.

17

Modelos Evaluados

505

Total de Benchmarks

11

Idiomas Evaluados

28 jul 2026

Última Actualización

01 · Líder

Universal-3.5 Pro Realtime

AssemblyAI

81.7

Puntuación

TTFW

1008 ms

Parpadeo

15.7%

WER

8.92%

02 · Segundo

Flux

Deepgram

79.4

Puntuación

TTFW

289 ms

Parpadeo

53.3%

WER

19.57%

03 · Tercero

Nova-3

Deepgram

78.2

Puntuación

TTFW

973 ms

Parpadeo

9.6%

WER

18.17%

#ModeloPuntuaciónTTFWParpadeoVaciadoWEREjecuciones

01

Universal-3.5 Pro Realtime

AssemblyAI

81.7

1008 ms

15.7%

109 ms

8.92%

33

02

Flux

Deepgram

79.4

289 ms

53.3%

0 ms

19.57%

25

03

Nova-3

Deepgram

78.2

973 ms

9.6%

181 ms

18.17%

34

04

Nova-2

Deepgram

78.0

986 ms

10.5%

192 ms

18.08%

34

05

Nova-2 Phone Call

Deepgram

77.8

975 ms

9.0%

186 ms

19.26%

25

06

Ink-2

Cartesia

77.6

1554 ms

0.0%

180 ms

14.85%

25

07

Nova-2 Conversational AI

Deepgram

77.4

1013 ms

10.5%

185 ms

18.80%

25

08

Nova-2 Voicemail

Deepgram

77.2

1014 ms

10.1%

194 ms

19.27%

25

09

Universal Streaming

AssemblyAI

75.9

1269 ms

3.9%

806 ms

19.11%

25

10

Nova-2 Meeting

Deepgram

75.9

1016 ms

13.6%

224 ms

20.83%

25

11

Nova-2 Finance

Deepgram

75.7

1014 ms

12.1%

191 ms

21.82%

25

12

Universal Streaming Multilingual

AssemblyAI

73.4

1496 ms

2.8%

791 ms

21.60%

29

13

Azure Speech

Microsoft Azure

72.4

2052 ms

13.2%

0 ms

15.82%

35

14

Soniox STT Realtime

Soniox

71.6

1459 ms

66.5%

0 ms

12.25%

35

15

Scribe v2 Realtime

ElevenLabs

68.9

2113 ms

57.9%

302 ms

11.60%

35

16

Gladia Solaria-1 (Realtime)

Gladia

68.2

1372 ms

89.9%

191 ms

16.89%

35

17

Ink-Whisper

Cartesia

67.1

4992 ms

0.0%

164 ms

18.19%

35

01

Universal-3.5 Pro Realtime

81.7

1008 ms TTFW

15.7% flicker

109 ms drain

8.92% WER

02

Flux

79.4

289 ms TTFW

53.3% flicker

0 ms drain

19.57% WER

03

Nova-3

78.2

973 ms TTFW

9.6% flicker

181 ms drain

18.17% WER

04

Nova-2

78.0

986 ms TTFW

10.5% flicker

192 ms drain

18.08% WER

05

Nova-2 Phone Call

77.8

975 ms TTFW

9.0% flicker

186 ms drain

19.26% WER

06

Ink-2

77.6

1554 ms TTFW

0.0% flicker

180 ms drain

14.85% WER

07

Nova-2 Conversational AI

77.4

1013 ms TTFW

10.5% flicker

185 ms drain

18.80% WER

08

Nova-2 Voicemail

77.2

1014 ms TTFW

10.1% flicker

194 ms drain

19.27% WER

09

Universal Streaming

75.9

1269 ms TTFW

3.9% flicker

806 ms drain

19.11% WER

10

Nova-2 Meeting

75.9

1016 ms TTFW

13.6% flicker

224 ms drain

20.83% WER

11

Nova-2 Finance

75.7

1014 ms TTFW

12.1% flicker

191 ms drain

21.82% WER

12

Universal Streaming Multilingual

73.4

1496 ms TTFW

2.8% flicker

791 ms drain

21.60% WER

13

Azure Speech

72.4

2052 ms TTFW

13.2% flicker

0 ms drain

15.82% WER

14

Soniox STT Realtime

71.6

1459 ms TTFW

66.5% flicker

0 ms drain

12.25% WER

15

Scribe v2 Realtime

68.9

2113 ms TTFW

57.9% flicker

302 ms drain

11.60% WER

16

Gladia Solaria-1 (Realtime)

68.2

1372 ms TTFW

89.9% flicker

191 ms drain

16.89% WER

17

Ink-Whisper

67.1

4992 ms TTFW

0.0% flicker

164 ms drain

18.19% WER

Cómo se construye la puntuación en tiempo real

compuesto ponderado

50%

Precisión

WER frente a transcripciones de referencia, transmitido en vivo

25%

Capacidad de respuesta

Tiempo mediano hasta la primera palabra mostrada, parcial o final

20%

Estabilidad

Con qué frecuencia se revisan los parciales anteriores antes de finalizar

5%

Latencia de cola

Tiempo de vaciado del último fragmento tras detenerse el audio

Métricas de streaming

cómo se mide la capacidad de respuesta

WER

Tasa de Error de Palabras

(Sustituciones + Inserciones + Eliminaciones) ÷ Palabras de Referencia

Precisión de la transcripción transmitida frente a la referencia — el ancla del 50% de la puntuación en tiempo real, la misma medida que el tablero por lotes (menor es mejor)

TTFW

Tiempo hasta la Primera Palabra

Tiempo desde el inicio del audio hasta la primera palabra mostrada, parcial o final (P50)

Qué tan rápido el modelo empieza a mostrar palabras (menor es mejor)

Flicker

Parpadeo

Palabras revisadas ÷ palabras totales emitidas

Con qué frecuencia cambian las palabras parciales anteriores antes de finalizar la transcripción (menor es mejor)

Cadence

Cadencia

Emisiones parciales por segundo de audio

Con qué frecuencia el modelo actualiza su transcripción parcial — contexto descriptivo, no puntuado

RTF

Factor de Tiempo Real

Tiempo de procesamiento ÷ duración del audio, a ritmo de reproducción 1×

Se lee ≈1.0 para un modelo en tiempo real bien comportado, ya que el audio se transmite a ritmo real — no es una métrica de 'menor siempre es mejor' como el factor de velocidad por lotes

Fuentes y licencias del corpus

El conjunto de referencia se construye con audio de licencia abierta. LibriSpeech y FLEURS son CC BY 4.0 y requieren atribución; el resto se acredita por transparencia.

LibriSpeech (test-clean) — CC BY 4.0

FLEURS — CC BY 4.0

Mozilla Common Voice — CC0 1.0

Earnings-21 — CC BY-SA 4.0

Bangor Miami (TalkBank) — GPLv3

Spoken Wikipedia CS Corpus — CC BY-SA 3.0

U.S. government recordings (SCOTUS, NIH/CDC) — Public domain

Original recordings — OpenTranscription

Enruta al modelo que gane.

Un solo endpoint, todos los proveedores. Fija el líder o deja que enrutemos automáticamente al mejor modelo según tu presupuesto de precisión y latencia.

Comienza gratisLeer la especificación ↗