Clasificador en tiempo real
Todos los modelos en tiempo real. El mismo audio. Puntuados en capacidad de respuesta, estabilidad y precisión — los ejes que importan cuando las palabras aparecen mientras hablas.
10 transcripciones gratis, hasta 2 horas al registrarte — sin tarjeta.
17
Modelos Evaluados
505
Total de Benchmarks
11
Idiomas Evaluados
28 jul 2026
Última Actualización
01 · Líder
Universal-3.5 Pro Realtime
AssemblyAI
81.7
Puntuación
TTFW
1008 ms
Parpadeo
15.7%
WER
8.92%
02 · Segundo
Flux
Deepgram
79.4
Puntuación
TTFW
289 ms
Parpadeo
53.3%
WER
19.57%
03 · Tercero
Nova-3
Deepgram
78.2
Puntuación
TTFW
973 ms
Parpadeo
9.6%
WER
18.17%
01
Universal-3.5 Pro Realtime
81.7
1008 ms TTFW
15.7% flicker
109 ms drain
8.92% WER
02
Flux
79.4
289 ms TTFW
53.3% flicker
0 ms drain
19.57% WER
03
Nova-3
78.2
973 ms TTFW
9.6% flicker
181 ms drain
18.17% WER
04
Nova-2
78.0
986 ms TTFW
10.5% flicker
192 ms drain
18.08% WER
05
Nova-2 Phone Call
77.8
975 ms TTFW
9.0% flicker
186 ms drain
19.26% WER
06
Ink-2
77.6
1554 ms TTFW
0.0% flicker
180 ms drain
14.85% WER
07
Nova-2 Conversational AI
77.4
1013 ms TTFW
10.5% flicker
185 ms drain
18.80% WER
08
Nova-2 Voicemail
77.2
1014 ms TTFW
10.1% flicker
194 ms drain
19.27% WER
09
Universal Streaming
75.9
1269 ms TTFW
3.9% flicker
806 ms drain
19.11% WER
10
Nova-2 Meeting
75.9
1016 ms TTFW
13.6% flicker
224 ms drain
20.83% WER
11
Nova-2 Finance
75.7
1014 ms TTFW
12.1% flicker
191 ms drain
21.82% WER
12
Universal Streaming Multilingual
73.4
1496 ms TTFW
2.8% flicker
791 ms drain
21.60% WER
13
Azure Speech
72.4
2052 ms TTFW
13.2% flicker
0 ms drain
15.82% WER
14
Soniox STT Realtime
71.6
1459 ms TTFW
66.5% flicker
0 ms drain
12.25% WER
15
Scribe v2 Realtime
68.9
2113 ms TTFW
57.9% flicker
302 ms drain
11.60% WER
16
Gladia Solaria-1 (Realtime)
68.2
1372 ms TTFW
89.9% flicker
191 ms drain
16.89% WER
17
Ink-Whisper
67.1
4992 ms TTFW
0.0% flicker
164 ms drain
18.19% WER
50%
Precisión
WER frente a transcripciones de referencia, transmitido en vivo
25%
Capacidad de respuesta
Tiempo mediano hasta la primera palabra mostrada, parcial o final
20%
Estabilidad
Con qué frecuencia se revisan los parciales anteriores antes de finalizar
5%
Latencia de cola
Tiempo de vaciado del último fragmento tras detenerse el audio
WER
Tasa de Error de Palabras
Precisión de la transcripción transmitida frente a la referencia — el ancla del 50% de la puntuación en tiempo real, la misma medida que el tablero por lotes (menor es mejor)
TTFW
Tiempo hasta la Primera Palabra
Qué tan rápido el modelo empieza a mostrar palabras (menor es mejor)
Flicker
Parpadeo
Con qué frecuencia cambian las palabras parciales anteriores antes de finalizar la transcripción (menor es mejor)
Cadence
Cadencia
Con qué frecuencia el modelo actualiza su transcripción parcial — contexto descriptivo, no puntuado
RTF
Factor de Tiempo Real
Se lee ≈1.0 para un modelo en tiempo real bien comportado, ya que el audio se transmite a ritmo real — no es una métrica de 'menor siempre es mejor' como el factor de velocidad por lotes
Fuentes y licencias del corpus
El conjunto de referencia se construye con audio de licencia abierta. LibriSpeech y FLEURS son CC BY 4.0 y requieren atribución; el resto se acredita por transparencia.
LibriSpeech (test-clean) — CC BY 4.0
Mozilla Common Voice — CC0 1.0
Bangor Miami (TalkBank) — GPLv3
Spoken Wikipedia CS Corpus — CC BY-SA 3.0
U.S. government recordings (SCOTUS, NIH/CDC) — Public domain
Original recordings — OpenTranscription
Un solo endpoint, todos los proveedores. Fija el líder o deja que enrutemos automáticamente al mejor modelo según tu presupuesto de precisión y latencia.