Catálogo · 43 modelos · 15 proveedores
Todos los modelos de voz a texto que valen la pena, una sola tarifa.
43
Modelos totales
105
Idiomas
$0.0007
Más barato /min
8.7%
Mejor WER
43 modelos
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
19 idiomas
(ver todos)
Google Cloud
Último modelo fundacional ASR generativo de Google — más de 85 idiomas
WER
CER
Factor de Velocidad
0.3x
Disponibilidad
Facturación
cada 15s
Retención
68 idiomas
(ver todos)
Google Cloud
Optimizado para consultas cortas y comandos de voz
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 15s
Retención
40 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.2x
Facturación
cada 15s
Retención
40 idiomas
(ver todos)
Speechmatics
Modelo de mayor precisión — más de 55 idiomas, el mejor de su clase
WER
CER
Factor de Velocidad
0.3x
Disponibilidad
Facturación
cada 1s
Retención
48 idiomas
(ver todos)
Deepgram
Modelo Enhanced de Deepgram — alta precisión para palabras poco comunes
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
15 idiomas
(ver todos)
Deepgram
Primer modelo ASR conversacional para agentes de voz — endpointing integrado en el modelo
TTFW (P50)
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
98 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
98 idiomas
(ver todos)
OpenAI
Transcripción GPT-4o con diarización de hablantes integrada
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
12 idiomas
(ver todos)
Cartesia
El nuevo STT en streaming de Cartesia — el menor WER de cualquier modelo en streaming, detección de turnos nativa y precisión en datos alfanuméricos como números de teléfono, correos y UUID. Por ahora solo en inglés.
TTFW (P50)
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Cartesia
Whisper rediseñado para IA de voz en tiempo real y por lotes — TTCT más rápido, cobertura en 99 idiomas
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
100 idiomas
(ver todos)
Google Cloud
Modelo Conformer para audio de larga duración (minutos a horas)
WER
CER
Factor de Velocidad
0.4x
Disponibilidad
Facturación
cada 15s
Retención
40 idiomas
(ver todos)
Google Cloud
Modelo Conformer para enunciados cortos (< 60s)
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 15s
Retención
40 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
33 idiomas
(ver todos)
Deepgram
Optimizado para interacciones humano-bot (IVR, asistentes de voz)
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Optimizado para llamadas de resultados con vocabulario financiero
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Optimizado para audio de salas de conferencias
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Optimizado para audio de llamadas telefónicas de bajo ancho de banda
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Optimizado para buzón de voz de un solo hablante de bajo ancho de banda
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Modelo insignia de Deepgram — 53% menos WER vs competidores, soporte de cambio de código
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
47 idiomas
(ver todos)
Alibaba (Qwen)
Qwen3-ASR Flash de Alibaba — transcripción por lotes multilingüe (más de 25 idiomas) con marcas de tiempo por palabra y detección automática de idioma, alojado en Model Studio (Singapur). Admite archivos de hasta 12 horas.
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
25 idiomas
(ver todos)
Rev AI
Rev AI Reverb — reconocimiento de voz asíncrono basado en el modelo Reverb ASR de Rev (entrenado con más de 3 millones de horas de audio transcrito por humanos), con diarización de hasta 8 hablantes y marcas de tiempo por palabra. Núcleo en inglés con amplio soporte de idiomas a través de la API asíncrona.
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
20 idiomas
(ver todos)
ElevenLabs
STT por lotes de última generación — más de 90 idiomas, diarización de hablantes, etiquetado de audio
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
76 idiomas
(ver todos)
ElevenLabs
STT de baja latencia más preciso — <150ms, más de 90 idiomas
TTFW (P50)
Factor de Velocidad
0.0x
Facturación
cada 1s
Retención
76 idiomas
(ver todos)
Gladia
Gladia Solaria-1 — reconocimiento de voz por streaming en tiempo real alojado en la UE para más de 100 idiomas con cambio de idioma nativo y latencia parcial de ~103ms. Marcas de tiempo por palabra e identificación automática de idioma; la diarización de hablantes está disponible por lotes (Solaria-3), no en este modelo de streaming.
TTFW (P50)
Factor de Velocidad
0.2x
Facturación
cada 1s
Retención
25 idiomas
(ver todos)
Gladia
Gladia Solaria-3 — reconocimiento de voz por lotes alojado en la UE optimizado para la máxima precisión en audio empresarial en cinco idiomas europeos principales (inglés, francés, alemán, español, italiano), con diarización de hablantes, vocabulario personalizado y marcas de tiempo por palabra.
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
5 idiomas
(ver todos)
Microsoft Azure
Modelo STT predeterminado de Azure — más de 140 idiomas, diarización, marcas de tiempo por palabra
WER
CER
Factor de Velocidad
0.3x
Facturación
cada 60s
Retención
19 idiomas
(ver todos)
Speechmatics
Modelo económico — respuesta rápida, más de 55 idiomas
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
48 idiomas
(ver todos)
Soniox
Transcripción por lotes asíncrona de Soniox — un modelo multilingüe para más de 60 idiomas con diarización de hablantes, marcas de tiempo por palabra e identificación automática de idioma, a una tarifa baja basada en tokens.
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
25 idiomas
(ver todos)
Soniox
Transcripción en tiempo real de Soniox — STT multilingüe de baja latencia para más de 60 idiomas con diarización de hablantes, marcas de tiempo por palabra e identificación automática de idioma a través de un único WebSocket.
TTFW (P50)
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
25 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 15s
Retención
9 idiomas
(ver todos)
Amazon Web Services
ASR impulsado por modelos fundacionales de AWS — más de 100 idiomas
WER
CER
Factor de Velocidad
0.4x
Disponibilidad
Facturación
cada 1s
Retención
77 idiomas
(ver todos)
Amazon Web Services
Transcripción médica con elegibilidad HIPAA
WER
CER
Factor de Velocidad
0.4x
Disponibilidad
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
AssemblyAI
AssemblyAI Universal-3.5 Pro Realtime — el modelo de streaming insignia, con cambio de idioma nativo a mitad de frase en 18 idiomas y contexto de conversación mantenido entre turnos. Marcas de tiempo por palabra y resultados parciales estables que no se reescriben conforme llegan; la diarización de hablantes está disponible en el modelo por lotes, no en este de streaming.
TTFW (P50)
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
18 idiomas
(ver todos)
AssemblyAI
El modelo de lenguaje de voz más potente de AssemblyAI — hasta 1000 frases clave
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
6 idiomas
(ver todos)
AssemblyAI
Diseñado para agentes de voz en tiempo real — transcripciones inmutables en ~300ms
TTFW (P50)
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
AssemblyAI
STT en streaming multilingüe — inglés, español, francés, alemán, italiano, portugués
TTFW (P50)
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
6 idiomas
(ver todos)
Mistral (Voxtral)
Voxtral Mini Transcribe de Mistral — transcripción por lotes alojada en la UE con diarización de hablantes, marcas de tiempo por segmento y vocabulario personalizado (context bias). Buena precisión a muy bajo costo; admite grabaciones de hasta 3 horas.
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
8 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.3x
Disponibilidad
Facturación
cada 1s
Retención
98 idiomas
(ver todos)
Groq
Whisper large-v3 de OpenAI ejecutado en el hardware LPU de Groq — la mejor precisión de Whisper a la velocidad y el costo de Groq, con marcas de tiempo por palabra y detección automática de idioma.
WER
CER
Factor de Velocidad
0.0x
Facturación
cada 1s
Retención
12 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.3x
Disponibilidad
Facturación
cada 1s
Retención
98 idiomas
(ver todos)
Groq
Whisper large-v3-turbo de OpenAI ejecutado en el hardware LPU de Groq — transcripción por lotes muy rápida y de muy bajo costo, con marcas de tiempo por palabra y detección automática de idioma.
WER
CER
Factor de Velocidad
0.0x
Disponibilidad
Facturación
cada 1s
Retención
12 idiomas
(ver todos)
Cada comparación que indexamos, agrupada por modelo.
Análisis a fondo sobre precisión, latencia y precios en transcripción de voz (en inglés).
What Amazon Transcribe Medical offers in 2026: features, specs, pricing vs Google and Nuance, HIPAA posture, research clues, and where it falls short.
What Google Cloud Chirp 3 actually is: release timeline, WER and Elo benchmarks, pricing, specs, known issues, and how it compares to Azure and ElevenLabs.
Where Deepgram Base fits in 2026: API behavior, variants, latency, specs, limitations, and when to pick Nova-3 or Flux instead.