Una sola API para cada modelo de voz a texto que vale la pena. Compara lado a lado, enruta al mejor, paga por segundo.
Cómo funciona · 3 pasos
1
Sube el audio
Arrastra cualquier archivo de audio — MP3, WAV, FLAC y 10 formatos más.
Arrastra archivo de audio
2
Elige un modelo — o déjanos elegir
Elige entre más de 30 modelos o usa nuestro router inteligente para seleccionar por precio, velocidad o precisión.
Whisper Large v3
Nova 3
Chirp 2
3
Obtén una transcripción estructurada
Recibe marcas de tiempo por palabra, etiquetas de hablante y puntuaciones de confianza en un formato unificado.
{
"start": 0.0,
"end": 2.4,
"text": "Welcome to...",
"speaker": "A",
"confidence": 0.97
}Funciones
Lo esencial desde el día que lanzas un producto de voz.
Una API para cada modelo. Diarización. 100+ idiomas. Streams en tiempo real. Trae tus propias claves. Benchmarks reales. Seis cosas, todo incluido.
01 / 06
Una API, todos los modelos
Más de 30 modelos de 15 proveedores a través de un solo endpoint unificado. Una integración, todas las opciones.
provider : "deepgram" →
response_shape :{ transcript, words[], speakers[], confidence }
endpoint : POST /v1/transcribe // sin cambios
01 / 06
Una API, todos los modelos
Más de 30 modelos de 15 proveedores a través de un solo endpoint unificado. Una integración, todas las opciones.
provider : "deepgram" →
response_shape :{ transcript, words[], speakers[], confidence }
endpoint : POST /v1/transcribe // sin cambios
02 / 06
Tiempo real + batch
Streaming por WebSocket desde micrófono o archivo. Batch asíncrono para audio pregrabado. Misma API.
01:07
02 / 06
Tiempo real + batch
Streaming por WebSocket desde micrófono o archivo. Batch asíncrono para audio pregrabado. Misma API.
01:07
03 / 06
Diarización de hablantes
Identifica quién dijo qué. Disponible en modelos compatibles con un solo flag.
0:02
Actualización rápida — el refactor de streaming se integró anoche.
0:05
Bien. ¿Cambió algo en las cifras de latencia?
0:09
Bajó como 15%. Publico la gráfica.
03 / 06
Diarización de hablantes
Identifica quién dijo qué. Disponible en modelos compatibles con un solo flag.
0:02
Actualización rápida — el refactor de streaming se integró anoche.
0:05
Bien. ¿Cambió algo en las cifras de latencia?
0:09
Bajó como 15%. Publico la gráfica.
04 / 06
100+ idiomas
Desde inglés hasta yoruba, con detección automática en modelos verificados. Mezcla de idiomas para audio multilingüe.
+ 86 más
04 / 06
100+ idiomas
Desde inglés hasta yoruba, con detección automática en modelos verificados. Mezcla de idiomas para audio multilingüe.
+ 86 más
05 / 06
Trae tu propia clave
Usa tus claves API de proveedor existentes. 100 minutos gratis al mes, 5% de comisión después.
Deepgram
activo
AssemblyAI
inactivo
05 / 06
Trae tu propia clave
Usa tus claves API de proveedor existentes. 100 minutos gratis al mes, 5% de comisión después.
Deepgram
activo
AssemblyAI
inactivo
06 / 06
Benchmarks reales
Puntuaciones WER sobre audio de referencia en 8 categorías. Basado en eventos, no en opiniones.
WER
1
2
3
06 / 06
Benchmarks reales
Puntuaciones WER sobre audio de referencia en 8 categorías. Basado en eventos, no en opiniones.
WER
1
2
3
Integración en una llamada
Los SDK se encargan de la subida y de la espera, en TypeScript o en Python. O llama directamente a la API HTTP.
Análisis a fondo sobre precisión, latencia y precios en transcripción de voz (en inglés).
What Amazon Transcribe Medical offers in 2026: features, specs, pricing vs Google and Nuance, HIPAA posture, research clues, and where it falls short.
What Google Cloud Chirp 3 actually is: release timeline, WER and Elo benchmarks, pricing, specs, known issues, and how it compares to Azure and ElevenLabs.
Where Deepgram Base fits in 2026: API behavior, variants, latency, specs, limitations, and when to pick Nova-3 or Flux instead.
$0.0007/min
precio más bajo
43+
modelos
105
idiomas
~772ms
latencia mínima
Cada modelo que vale la pena
Cada modelo que vale la pena
Deepgram
Google Cloud
Speechmatics
OpenAI
Cartesia
Alibaba (Qwen)
Rev AI
El Ranker
Ejecutamos benchmarks WER automatizados contra audio de referencia en 8 categorías — general, médico, legal, técnico, conversacional, ruidoso, financiero y mezcla de idiomas. Los benchmarks se disparan con cada cambio de modelo o precio.
Ranker en vivo
| # | Modelo | Puntuación | WER | Latencia | Costo/min |
|---|---|---|---|---|---|
01 | Ink-Whisper Cartesia | 84.6 | 17.2% | 773ms | $0.0022 |
02 | Whisper Large V3 Turbo Groq | 81.3 | 14.3% | 3.4s | $0.0007 |
03 | GPT-4o Mini Transcribe OpenAI | 81.1 | 13.6% | 2.0s | $0.003 |
04 | Voxtral Mini Transcribe Mistral (Voxtral) | 80.7 | 12.7% | 2.3s | $0.003 |
05 | Whisper Large V3 Groq | 79.9 | 14.4% | 3.1s | $0.0019 |
84.6
WER: 17.2%
Latencia: 773ms
Costo/min: $0.0022
WER: 14.3%
Latencia: 3.4s
Costo/min: $0.0007
WER: 13.6%
Latencia: 2.0s
Costo/min: $0.003
WER: 12.7%
Latencia: 2.3s
Costo/min: $0.003
79.9
WER: 14.4%
Latencia: 3.1s
Costo/min: $0.0019
+38 modelos más
Ver ranker completo+38 modelos más
Ver ranker completoClasificado por un compuesto de precisión, costo y velocidad. Ver metodología
Precios · transparente
Una tarifa única para todos los proveedores. El precio que ves es el que pagas. Los usuarios BYOK pagan directamente a su proveedor.
Empieza gratis
Cada cuenta nueva recibe 10 transcripciones gratis, hasta 2 horas de audio — sin tarjeta de crédito.
Desde
$0.0007
/ minuto
Facturación por segundo. Recarga créditos cuando quieras y úsalos en todos los proveedores.
5%
tarifa de enrutamiento
¿Ya tienes cuentas con proveedores? Trae tus llaves, paga directamente a tu proveedor — nosotros añadimos una tarifa de enrutamiento del 5%.
Personalizado
Para equipos con grandes volúmenes, despliegue personalizado o necesidades de soporte.
Sin suscripciones, sin mínimos.
Una clave API. Sin contratos. Sin gasto mínimo.