Voz, decodificada.

Una sola API para cada modelo de voz a texto que vale la pena. Compara lado a lado, enruta al mejor, paga por segundo.

Compara modelos con tu audio →Empieza a construir

Cómo funciona · 3 pasos

De audio a transcripción en segundos.

1

Sube el audio

Arrastra cualquier archivo de audio — MP3, WAV, FLAC y más de 20 formatos.

Arrastra archivo de audio

2

Elige un modelo — o déjanos elegir

Elige entre más de 30 modelos o usa nuestro router inteligente para seleccionar por precio, velocidad o precisión.

Whisper Large v3

Nova 3

Chirp 2

3

Obtén una transcripción estructurada

Recibe marcas de tiempo por palabra, etiquetas de hablante y puntuaciones de confianza en un formato unificado.

{
  "start": 0.0,
  "end": 2.4,
  "text": "Welcome to...",
  "speaker": "A",
  "confidence": 0.97
}

Hecho para producción, no para demos

Todo lo que construirías de todos modos.

Lo esencial desde el día que lanzas un producto de voz.

Una API para cada modelo. Diarización. 100+ idiomas. Streams en tiempo real. Trae tus propias claves. Benchmarks reales. Seis cosas, todo incluido.

01 / 06

Una API, todos los modelos

Más de 30 modelos de 9 proveedores a través de un solo endpoint unificado. Una integración, todas las opciones.

provider : "deepgram" →

"assemblyai"

response_shape :{ transcript, words[], speakers[], confidence }

endpoint : POST /v1/transcribe // sin cambios

01 / 06

Una API, todos los modelos

Más de 30 modelos de 9 proveedores a través de un solo endpoint unificado. Una integración, todas las opciones.

provider : "deepgram" →

"assemblyai"

response_shape :{ transcript, words[], speakers[], confidence }

endpoint : POST /v1/transcribe // sin cambios

02 / 06

Tiempo real + batch

Streaming por WebSocket desde micrófono o archivo. Batch asíncrono para audio pregrabado. Misma API.

01:07

~120ms

02 / 06

Tiempo real + batch

Streaming por WebSocket desde micrófono o archivo. Batch asíncrono para audio pregrabado. Misma API.

01:07

~120ms

03 / 06

Diarización de hablantes

Identifica quién dijo qué. Disponible en modelos compatibles con un solo flag.

S1

0:02

Actualización rápida — el refactor de streaming se integró anoche.

S2

0:05

Bien. ¿Cambió algo en las cifras de latencia?

S1

0:09

Bajó como 15%. Publico la gráfica.

03 / 06

Diarización de hablantes

Identifica quién dijo qué. Disponible en modelos compatibles con un solo flag.

S1

0:02

Actualización rápida — el refactor de streaming se integró anoche.

S2

0:05

Bien. ¿Cambió algo en las cifras de latencia?

S1

0:09

Bajó como 15%. Publico la gráfica.

04 / 06

100+ idiomas

Desde inglés hasta yoruba, con detección automática en modelos verificados. Mezcla de idiomas para audio multilingüe.

EN
ES
DE
FR
JA
ZH
AR
HI
PT
RU
KO
IT
TR
PL
NL
SV
TH
VI

+ 86 más

04 / 06

100+ idiomas

Desde inglés hasta yoruba, con detección automática en modelos verificados. Mezcla de idiomas para audio multilingüe.

EN
ES
DE
FR
JA
ZH
AR
HI
PT
RU
KO
IT
TR
PL
NL
SV
TH
VI

+ 86 más

05 / 06

Trae tu propia clave

Usa tus claves API de proveedor existentes. 100 minutos gratis al mes, 5% de comisión después.

Deepgram

················3f9a

activo

AssemblyAI

················a017

inactivo

05 / 06

Trae tu propia clave

Usa tus claves API de proveedor existentes. 100 minutos gratis al mes, 5% de comisión después.

Deepgram

················3f9a

activo

AssemblyAI

················a017

inactivo

06 / 06

Benchmarks reales

Puntuaciones WER sobre audio de referencia en 8 categorías. Basado en eventos, no en opiniones.

WER

01

02

03

06 / 06

Benchmarks reales

Puntuaciones WER sobre audio de referencia en 8 categorías. Basado en eventos, no en opiniones.

WER

01

02

03

Integración en cinco líneas

Si puedes llamar fetch, puedes transcribir.

Una solicitud. Respuesta estructurada. Sin SDK necesario.

# 1. Request a signed upload URL
curl https://opentranscription.io/api/v1/uploads \
-H "Authorization: Bearer $OT_API_KEY" \
-H "Content-Type: application/json" \
-d '{ "file_name": "interview.mp3", "file_size": 3456789, "mime_type": "audio/mpeg" }'
# → { "upload_url": "...", "file_path": "...", "expires_at": "..." }
# 2. Upload the audio bytes to the signed URL
curl -X PUT "$UPLOAD_URL" --upload-file interview.mp3
# 3. Create the transcription job
curl https://opentranscription.io/api/v1/transcriptions \
-H "Authorization: Bearer $OT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"file_path": "$FILE_PATH",
"model": "auto/best",
"language": "en",
"webhook_url": "https://your-app.com/webhooks/ot"
}'
# → we POST a signed event to your webhook_url when the job finishes — no polling required

↳ auto/best dirige al modelo más preciso por defecto.

Referencia de la API

¿Listo para transcribir?

Una clave API. Sin contratos. Sin gasto mínimo.

Compara modelos con tu audio →Obtén una clave API

Precios · transparente

Paga por segundo. Sin suscripciones.

Una tarifa única para todos los proveedores. El precio que ves es el que pagas. Los usuarios BYOK pagan directamente a su proveedor.

Empieza gratis

Cada cuenta nueva recibe 10 transcripciones gratis, hasta 2 horas de audio — sin tarjeta de crédito.

Compara modelos con tu audio →
Paga por uso

Desde

$0.0007

/ minuto

Facturación por segundo. Recarga créditos cuando quieras y úsalos en todos los proveedores.

  • Todos los modelos incluidos
  • Sin mínimo mensual
  • Paga solo por el audio procesado
Obtener una API key
BYOK

5%

tarifa de enrutamiento

¿Ya tienes cuentas con proveedores? Trae tus llaves, paga directamente a tu proveedor — nosotros añadimos una tarifa de enrutamiento del 5%.

  • Tus llaves, tu facturación con el proveedor
  • Mismo playground + ranker
  • Primeros 100 min/mes gratis, luego 5%
Configurar BYOK
Empresa

Personalizado

Para equipos con grandes volúmenes, despliegue personalizado o necesidades de soporte.

  • Precios por volumen
  • Opciones de despliegue personalizado
  • Facturación + términos personalizados
Hablar con ventas

Sin suscripciones, sin mínimos.

Cada modelo que vale la pena

Cada modelo que vale la pena

Deepgram

AssemblyAI

Google Cloud

Speechmatics

OpenAI

Cartesia

Alibaba (Qwen)

$0.0007/min

precio más bajo

40+

modelos

106

idiomas

~695ms

latencia mínima

El Ranker

Benchmarks objetivos. Sin favoritismos.

Ejecutamos benchmarks WER automatizados contra audio de referencia en 8 categorías — general, médico, legal, técnico, conversacional, ruidoso, financiero y mezcla de idiomas. Los benchmarks se disparan con cada cambio de modelo o precio.

Ranker en vivo

#ModeloPuntuaciónWERLatenciaCosto/min

01

Ink-Whisper

Cartesia

82.5

22.0%

695ms

$0.0022

02

Whisper Large V3 Turbo

Groq

81.3

14.3%

3.4s

$0.0007

03

GPT-4o Mini Transcribe

OpenAI

81.1

13.6%

2.0s

$0.003

04

Voxtral Mini Transcribe

Mistral (Voxtral)

80.7

12.7%

2.3s

$0.003

05

Whisper Large V3

Groq

79.9

14.4%

3.1s

$0.0019

01

Ink-Whisper

Cartesia

82.5

WER: 22.0%

Latencia: 695ms

Costo/min: $0.0022

02

Whisper Large V3 Turbo

Groq

81.3

WER: 14.3%

Latencia: 3.4s

Costo/min: $0.0007

03

GPT-4o Mini Transcribe

OpenAI

81.1

WER: 13.6%

Latencia: 2.0s

Costo/min: $0.003

04

Voxtral Mini Transcribe

Mistral (Voxtral)

80.7

WER: 12.7%

Latencia: 2.3s

Costo/min: $0.003

+35 modelos más

Ver ranker completo

+35 modelos más

Ver ranker completo

Clasificado por un compuesto de precisión, costo y velocidad. Ver metodología

05

Whisper Large V3

Groq

79.9

WER: 14.4%

Latencia: 3.1s

Costo/min: $0.0019