Una sola API para cada modelo de voz a texto que vale la pena. Compara lado a lado, enruta al mejor, paga por segundo.
Cómo funciona · 3 pasos
1
Sube el audio
Arrastra cualquier archivo de audio — MP3, WAV, FLAC y más de 20 formatos.
Arrastra archivo de audio
2
Elige un modelo — o déjanos elegir
Elige entre más de 30 modelos o usa nuestro router inteligente para seleccionar por precio, velocidad o precisión.
Whisper Large v3
Nova 3
Chirp 2
3
Obtén una transcripción estructurada
Recibe marcas de tiempo por palabra, etiquetas de hablante y puntuaciones de confianza en un formato unificado.
{
"start": 0.0,
"end": 2.4,
"text": "Welcome to...",
"speaker": "A",
"confidence": 0.97
}Hecho para producción, no para demos
Lo esencial desde el día que lanzas un producto de voz.
Una API para cada modelo. Diarización. 100+ idiomas. Streams en tiempo real. Trae tus propias claves. Benchmarks reales. Seis cosas, todo incluido.
01 / 06
Una API, todos los modelos
Más de 30 modelos de 9 proveedores a través de un solo endpoint unificado. Una integración, todas las opciones.
provider : "deepgram" →
response_shape :{ transcript, words[], speakers[], confidence }
endpoint : POST /v1/transcribe // sin cambios
01 / 06
Una API, todos los modelos
Más de 30 modelos de 9 proveedores a través de un solo endpoint unificado. Una integración, todas las opciones.
provider : "deepgram" →
response_shape :{ transcript, words[], speakers[], confidence }
endpoint : POST /v1/transcribe // sin cambios
02 / 06
Tiempo real + batch
Streaming por WebSocket desde micrófono o archivo. Batch asíncrono para audio pregrabado. Misma API.
01:07
02 / 06
Tiempo real + batch
Streaming por WebSocket desde micrófono o archivo. Batch asíncrono para audio pregrabado. Misma API.
01:07
03 / 06
Diarización de hablantes
Identifica quién dijo qué. Disponible en modelos compatibles con un solo flag.
0:02
Actualización rápida — el refactor de streaming se integró anoche.
0:05
Bien. ¿Cambió algo en las cifras de latencia?
0:09
Bajó como 15%. Publico la gráfica.
03 / 06
Diarización de hablantes
Identifica quién dijo qué. Disponible en modelos compatibles con un solo flag.
0:02
Actualización rápida — el refactor de streaming se integró anoche.
0:05
Bien. ¿Cambió algo en las cifras de latencia?
0:09
Bajó como 15%. Publico la gráfica.
04 / 06
100+ idiomas
Desde inglés hasta yoruba, con detección automática en modelos verificados. Mezcla de idiomas para audio multilingüe.
+ 86 más
04 / 06
100+ idiomas
Desde inglés hasta yoruba, con detección automática en modelos verificados. Mezcla de idiomas para audio multilingüe.
+ 86 más
05 / 06
Trae tu propia clave
Usa tus claves API de proveedor existentes. 100 minutos gratis al mes, 5% de comisión después.
Deepgram
activo
AssemblyAI
inactivo
05 / 06
Trae tu propia clave
Usa tus claves API de proveedor existentes. 100 minutos gratis al mes, 5% de comisión después.
Deepgram
activo
AssemblyAI
inactivo
06 / 06
Benchmarks reales
Puntuaciones WER sobre audio de referencia en 8 categorías. Basado en eventos, no en opiniones.
WER
01
02
03
06 / 06
Benchmarks reales
Puntuaciones WER sobre audio de referencia en 8 categorías. Basado en eventos, no en opiniones.
WER
01
02
03
Integración en cinco líneas
Una solicitud. Respuesta estructurada. Sin SDK necesario.
Una clave API. Sin contratos. Sin gasto mínimo.
Precios · transparente
Una tarifa única para todos los proveedores. El precio que ves es el que pagas. Los usuarios BYOK pagan directamente a su proveedor.
Empieza gratis
Cada cuenta nueva recibe 10 transcripciones gratis, hasta 2 horas de audio — sin tarjeta de crédito.
Desde
$0.0007
/ minuto
Facturación por segundo. Recarga créditos cuando quieras y úsalos en todos los proveedores.
5%
tarifa de enrutamiento
¿Ya tienes cuentas con proveedores? Trae tus llaves, paga directamente a tu proveedor — nosotros añadimos una tarifa de enrutamiento del 5%.
Personalizado
Para equipos con grandes volúmenes, despliegue personalizado o necesidades de soporte.
Sin suscripciones, sin mínimos.
Cada modelo que vale la pena
Cada modelo que vale la pena
Deepgram
AssemblyAI
Google Cloud
Speechmatics
OpenAI
Cartesia
Alibaba (Qwen)
$0.0007/min
precio más bajo
40+
modelos
106
idiomas
~695ms
latencia mínima
El Ranker
Ejecutamos benchmarks WER automatizados contra audio de referencia en 8 categorías — general, médico, legal, técnico, conversacional, ruidoso, financiero y mezcla de idiomas. Los benchmarks se disparan con cada cambio de modelo o precio.
Ranker en vivo
| # | Modelo | Puntuación | WER | Latencia | Costo/min |
|---|---|---|---|---|---|
01 | Ink-Whisper Cartesia | 82.5 | 22.0% | 695ms | $0.0022 |
02 | Whisper Large V3 Turbo Groq | 81.3 | 14.3% | 3.4s | $0.0007 |
03 | GPT-4o Mini Transcribe OpenAI | 81.1 | 13.6% | 2.0s | $0.003 |
04 | Voxtral Mini Transcribe Mistral (Voxtral) | 80.7 | 12.7% | 2.3s | $0.003 |
05 | Whisper Large V3 Groq | 79.9 | 14.4% | 3.1s | $0.0019 |
01
Ink-Whisper
Cartesia
82.5
WER: 22.0%
Latencia: 695ms
Costo/min: $0.0022
02
Whisper Large V3 Turbo
Groq
81.3
WER: 14.3%
Latencia: 3.4s
Costo/min: $0.0007
03
GPT-4o Mini Transcribe
OpenAI
81.1
WER: 13.6%
Latencia: 2.0s
Costo/min: $0.003
04
Voxtral Mini Transcribe
Mistral (Voxtral)
80.7
WER: 12.7%
Latencia: 2.3s
Costo/min: $0.003
+35 modelos más
Ver ranker completo+35 modelos más
Ver ranker completoClasificado por un compuesto de precisión, costo y velocidad. Ver metodología
05
Whisper Large V3
Groq
79.9
WER: 14.4%
Latencia: 3.1s
Costo/min: $0.0019