Catálogo · 40 modelos · 13 proveedores
Todos los modelos de voz a texto que valen la pena, una sola tarifa.
40
Modelos totales
106
Idiomas
$0.0007
Más barato /min
4.7%
Mejor WER
40 modelos
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
19 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.3x
Disponibilidad
Facturación
cada 1s
Retención
78 idiomas
(ver todos)
Google Cloud
Último modelo fundacional ASR generativo de Google — más de 85 idiomas
WER
CER
Factor de Velocidad
0.3x
Disponibilidad
Facturación
cada 15s
Retención
72 idiomas
(ver todos)
Google Cloud
Optimizado para consultas cortas y comandos de voz
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 15s
Retención
40 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.2x
Facturación
cada 15s
Retención
40 idiomas
(ver todos)
Deepgram
Modelo Enhanced de Deepgram — alta precisión para palabras poco comunes
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
15 idiomas
(ver todos)
Speechmatics
Modelo de mayor precisión — más de 55 idiomas, el mejor de su clase
WER
CER
Factor de Velocidad
0.3x
Disponibilidad
Facturación
cada 1s
Retención
48 idiomas
(ver todos)
Deepgram
Primer modelo ASR conversacional para agentes de voz — endpointing integrado en el modelo
TTFW (P50)
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
98 idiomas
(ver todos)
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
98 idiomas
(ver todos)
OpenAI
Transcripción GPT-4o con diarización de hablantes integrada
WER
CER
Factor de Velocidad
0.2x
Facturación
cada 1s
Retención
12 idiomas
(ver todos)
Cartesia
El nuevo STT en streaming de Cartesia — el menor WER de cualquier modelo en streaming, detección de turnos nativa y precisión en datos alfanuméricos como números de teléfono, correos y UUID. Por ahora solo en inglés.
TTFW (P50)
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Cartesia
Whisper rediseñado para IA de voz en tiempo real y por lotes — TTCT más rápido, cobertura en 99 idiomas
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
100 idiomas
(ver todos)
Google Cloud
Modelo Conformer para audio de larga duración (minutos a horas)
WER
CER
Factor de Velocidad
0.4x
Facturación
cada 15s
Retención
40 idiomas
(ver todos)
Google Cloud
Modelo Conformer para enunciados cortos (< 60s)
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 15s
Retención
40 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
33 idiomas
(ver todos)
Deepgram
Optimizado para interacciones humano-bot (IVR, asistentes de voz)
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Optimizado para llamadas de resultados con vocabulario financiero
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Optimizado para audio de salas de conferencias
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Optimizado para audio de llamadas telefónicas de bajo ancho de banda
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Optimizado para buzón de voz de un solo hablante de bajo ancho de banda
WER
CER
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
Deepgram
Modelo insignia de Deepgram — 53% menos WER vs competidores, soporte de cambio de código
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
47 idiomas
(ver todos)
Alibaba (Qwen)
Qwen3-ASR Flash de Alibaba — transcripción por lotes multilingüe (más de 25 idiomas) con marcas de tiempo por palabra y detección automática de idioma, alojado en Model Studio (Singapur). Admite archivos de hasta 12 horas.
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
25 idiomas
(ver todos)
Rev AI
Rev AI Reverb — reconocimiento de voz asíncrono basado en el modelo Reverb ASR de Rev (entrenado con más de 3 millones de horas de audio transcrito por humanos), con diarización de hasta 8 hablantes y marcas de tiempo por palabra. Núcleo en inglés con amplio soporte de idiomas a través de la API asíncrona.
WER
CER
Factor de Velocidad
0.2x
Facturación
cada 1s
Retención
20 idiomas
(ver todos)
ElevenLabs
STT por lotes de última generación — más de 90 idiomas, diarización de hablantes, etiquetado de audio
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
76 idiomas
(ver todos)
ElevenLabs
STT de baja latencia más preciso — <150ms, más de 90 idiomas
TTFW (P50)
Factor de Velocidad
0.0x
Facturación
cada 1s
Retención
76 idiomas
(ver todos)
Gladia
Gladia Solaria-1 — reconocimiento de voz por streaming en tiempo real alojado en la UE para más de 100 idiomas con cambio de idioma nativo y latencia parcial de ~103ms. Marcas de tiempo por palabra e identificación automática de idioma; la diarización de hablantes está disponible por lotes (Solaria-3), no en este modelo de streaming.
TTFW (P50)
Factor de Velocidad
0.2x
Facturación
cada 1s
Retención
25 idiomas
(ver todos)
Gladia
Gladia Solaria-3 — reconocimiento de voz por lotes alojado en la UE optimizado para la máxima precisión en audio empresarial en cinco idiomas europeos principales (inglés, francés, alemán, español, italiano), con diarización de hablantes, vocabulario personalizado y marcas de tiempo por palabra.
WER
CER
Factor de Velocidad
0.2x
Facturación
cada 1s
Retención
5 idiomas
(ver todos)
Speechmatics
Modelo económico — respuesta rápida, más de 55 idiomas
WER
CER
Factor de Velocidad
0.1x
Disponibilidad
Facturación
cada 1s
Retención
48 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 15s
Retención
9 idiomas
(ver todos)
Amazon Web Services
ASR impulsado por modelos fundacionales de AWS — más de 100 idiomas
WER
CER
Factor de Velocidad
0.4x
Disponibilidad
Facturación
cada 1s
Retención
77 idiomas
(ver todos)
Amazon Web Services
Transcripción médica con elegibilidad HIPAA
WER
CER
Factor de Velocidad
0.4x
Disponibilidad
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
AssemblyAI
El modelo de lenguaje de voz más potente de AssemblyAI — hasta 1000 frases clave
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
6 idiomas
(ver todos)
AssemblyAI
Diseñado para agentes de voz en tiempo real — transcripciones inmutables en ~300ms
TTFW (P50)
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
1 idiomas
(ver todos)
AssemblyAI
STT en streaming multilingüe — inglés, español, francés, alemán, italiano, portugués
TTFW (P50)
Factor de Velocidad
0.1x
Facturación
cada 1s
Retención
6 idiomas
(ver todos)
Mistral (Voxtral)
Voxtral Mini Transcribe de Mistral — transcripción por lotes alojada en la UE con diarización de hablantes, marcas de tiempo por segmento y vocabulario personalizado (context bias). Buena precisión a muy bajo costo; admite grabaciones de hasta 3 horas.
WER
CER
Factor de Velocidad
0.2x
Disponibilidad
Facturación
cada 1s
Retención
8 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.3x
Facturación
cada 1s
Retención
98 idiomas
(ver todos)
Groq
Whisper large-v3 de OpenAI ejecutado en el hardware LPU de Groq — la mejor precisión de Whisper a la velocidad y el costo de Groq, con marcas de tiempo por palabra y detección automática de idioma.
Factor de Velocidad
0.0x
Facturación
cada 1s
Retención
12 idiomas
(ver todos)
WER
CER
Factor de Velocidad
0.3x
Disponibilidad
Facturación
cada 1s
Retención
98 idiomas
(ver todos)
Groq
Whisper large-v3-turbo de OpenAI ejecutado en el hardware LPU de Groq — transcripción por lotes muy rápida y de muy bajo costo, con marcas de tiempo por palabra y detección automática de idioma.
Factor de Velocidad
0.0x
Disponibilidad
Facturación
cada 1s
Retención
12 idiomas
(ver todos)