Rango de Precio

$0.0007

$0.09

Cumplimiento

Funciones

Mejor para:

Catálogo · 40 modelos · 13 proveedores

Modelos de transcripción.

Todos los modelos de voz a texto que valen la pena, una sola tarifa.

40

Modelos totales

106

Idiomas

$0.0007

Más barato /min

4.7%

Mejor WER

40 modelos

Base

Deepgram

Por lotes
Estados Unidos

Modelo Base de Deepgram — alto volumen, económico

$0.0145/min

WER

42.78%

CER

47.68%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

19 idiomas

(ver todos)

Detección automáticaDiarizaciónMarcas de tiempo por palabra+1
TranscribirVer Benchmarks
AssemblyAI Best

AssemblyAI

Por lotes
Estados Unidos

El mejor modelo de transcripción de AssemblyAI

$0.09/min

WER

20.48%

CER

11.80%

Factor de Velocidad

0.3x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

78 idiomas

(ver todos)

Detección automáticaDiarizaciónMarcas de tiempo por palabra+1
TranscribirVer Benchmarks
Chirp 3

Google Cloud

Por lotes
Estados Unidos

Último modelo fundacional ASR generativo de Google — más de 85 idiomas

$0.0107/min

WER

9.37%

CER

4.79%

Factor de Velocidad

0.3x

Disponibilidad

100.0%

Facturación

cada 15s

Retención

Personalizada

72 idiomas

(ver todos)

GenerativoDetección automáticaDiarización+2
TranscribirVer Benchmarks
Google Command & Search

Google Cloud

Por lotes
Estados Unidos

Optimizado para consultas cortas y comandos de voz

$0.016/min

WER

47.19%

CER

21.87%

Factor de Velocidad

0.1x

Facturación

cada 15s

Retención

Personalizada

40 idiomas

(ver todos)

Marcas de tiempo por palabra
TranscribirVer Benchmarks
Google Default

Google Cloud

Por lotes
Estados Unidos

Modelo de propósito general

$0.016/min

WER

45.74%

CER

36.56%

Factor de Velocidad

0.2x

Facturación

cada 15s

Retención

Personalizada

40 idiomas

(ver todos)

DiarizaciónMarcas de tiempo por palabra
TranscribirVer Benchmarks
Enhanced

Deepgram

Por lotes
Estados Unidos

Modelo Enhanced de Deepgram — alta precisión para palabras poco comunes

$0.0165/min

WER

25.24%

CER

15.53%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

15 idiomas

(ver todos)

Detección automáticaDiarizaciónMarcas de tiempo por palabra+1
TranscribirVer Benchmarks
Speechmatics Enhanced

Speechmatics

Por lotes
Europa

Modelo de mayor precisión — más de 55 idiomas, el mejor de su clase

$0.0083/min
Mejor Acentuado

WER

16.87%

CER

9.29%

Factor de Velocidad

0.3x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

48 idiomas

(ver todos)

API asíncronaDetección automáticaDiarización+3
TranscribirVer Benchmarks
Flux

Deepgram

Tiempo real
Estados Unidos

Primer modelo ASR conversacional para agentes de voz — endpointing integrado en el modelo

$0.0077/min

TTFW (P50)

293 ms

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

endpointing
CS
turn detection+1
TranscribirVer Benchmarks
GPT-4o Mini Transcribe

OpenAI

Por lotes
Estados Unidos

GPT-4o Mini optimizado para transcripción rápida

$0.003/min

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

98 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
GPT-4o Transcribe

OpenAI

Por lotes
Estados Unidos

GPT-4o optimizado para transcripción con WER mejorado

$0.006/min

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

98 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
GPT-4o Transcribe Diarize

OpenAI

Por lotes
Estados Unidos

Transcripción GPT-4o con diarización de hablantes integrada

$0.006/min

WER

14.90%

CER

8.59%

Factor de Velocidad

0.2x

Facturación

cada 1s

Retención

Sin retención

12 idiomas

(ver todos)

Detección automáticaDiarización
TranscribirVer Benchmarks
Ink-2

Cartesia

Tiempo real
Estados Unidos

El nuevo STT en streaming de Cartesia — el menor WER de cualquier modelo en streaming, detección de turnos nativa y precisión en datos alfanuméricos como números de teléfono, correos y UUID. Por ahora solo en inglés.

$0.0065/min

TTFW (P50)

1418 ms

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

streamingendpointingturn detection+1
TranscribirVer Benchmarks
Ink-Whisper

Cartesia

Lotes y Tiempo real
Estados Unidos

Whisper rediseñado para IA de voz en tiempo real y por lotes — TTCT más rápido, cobertura en 99 idiomas

$0.0022/min

WER

23.08%

CER

11.38%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

100 idiomas

(ver todos)

Marcas de tiempo por palabradynamic chunking
TranscribirVer Benchmarks
Google Latest (Long)

Google Cloud

Por lotes
Estados Unidos

Modelo Conformer para audio de larga duración (minutos a horas)

$0.0107/min

WER

22.54%

CER

10.26%

Factor de Velocidad

0.4x

Facturación

cada 15s

Retención

Personalizada

40 idiomas

(ver todos)

Marcas de tiempo por palabra
TranscribirVer Benchmarks
Google Latest (Short)

Google Cloud

Por lotes
Estados Unidos

Modelo Conformer para enunciados cortos (< 60s)

$0.016/min

WER

63.82%

CER

57.52%

Factor de Velocidad

0.1x

Facturación

cada 15s

Retención

Personalizada

40 idiomas

(ver todos)

Marcas de tiempo por palabra
TranscribirVer Benchmarks
Nova-2

Deepgram

Lotes y Tiempo real
Estados Unidos

Reconocimiento de voz Nova-2 de Deepgram

$0.0058/min

WER

23.62%

CER

20.01%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

33 idiomas

(ver todos)

Detección automáticaDiarización
CS
+2
TranscribirVer Benchmarks
Nova-2 Conversational AI

Deepgram

Lotes y Tiempo real
Estados Unidos

Optimizado para interacciones humano-bot (IVR, asistentes de voz)

$0.0058/min

WER

19.02%

CER

13.21%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

Diarización
CS
Marcas de tiempo por palabra+1
TranscribirVer Benchmarks
Nova-2 Finance

Deepgram

Lotes y Tiempo real
Estados Unidos

Optimizado para llamadas de resultados con vocabulario financiero

$0.0058/min

WER

18.58%

CER

13.25%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

Diarización
CS
Marcas de tiempo por palabra+1
TranscribirVer Benchmarks
Nova-2 Meeting

Deepgram

Lotes y Tiempo real
Estados Unidos

Optimizado para audio de salas de conferencias

$0.0058/min

WER

17.99%

CER

13.41%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

Diarización
CS
Marcas de tiempo por palabra+1
TranscribirVer Benchmarks
Nova-2 Phone Call

Deepgram

Lotes y Tiempo real
Estados Unidos

Optimizado para audio de llamadas telefónicas de bajo ancho de banda

$0.0058/min

WER

16.48%

CER

11.74%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

Diarización
CS
Marcas de tiempo por palabra+1
TranscribirVer Benchmarks
Nova-2 Voicemail

Deepgram

Lotes y Tiempo real
Estados Unidos

Optimizado para buzón de voz de un solo hablante de bajo ancho de banda

$0.0058/min

WER

17.33%

CER

12.48%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

CS
Marcas de tiempo por palabraVocabulario personalizado
TranscribirVer Benchmarks
Nova-3

Deepgram

Lotes y Tiempo real
Estados Unidos

Modelo insignia de Deepgram — 53% menos WER vs competidores, soporte de cambio de código

$0.0077/min

WER

30.75%

CER

35.97%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

47 idiomas

(ver todos)

Detección automáticaDiarizaciónFormato inteligente+3
TranscribirVer Benchmarks
Qwen3 ASR Flash

Alibaba (Qwen)

Por lotes
Singapore

Qwen3-ASR Flash de Alibaba — transcripción por lotes multilingüe (más de 25 idiomas) con marcas de tiempo por palabra y detección automática de idioma, alojado en Model Studio (Singapur). Admite archivos de hasta 12 horas.

$0.0021/min

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

25 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Rev AI Reverb

Rev AI

Por lotes
Estados Unidos

Rev AI Reverb — reconocimiento de voz asíncrono basado en el modelo Reverb ASR de Rev (entrenado con más de 3 millones de horas de audio transcrito por humanos), con diarización de hasta 8 hablantes y marcas de tiempo por palabra. Núcleo en inglés con amplio soporte de idiomas a través de la API asíncrona.

$0.003/min
Mejor Conversacional

WER

18.67%

CER

14.93%

Factor de Velocidad

0.2x

Facturación

cada 1s

Retención

Sin retención

20 idiomas

(ver todos)

DiarizaciónMarcas de tiempo por palabra
TranscribirVer Benchmarks
Scribe v2

ElevenLabs

Por lotes
Estados Unidos

STT por lotes de última generación — más de 90 idiomas, diarización de hablantes, etiquetado de audio

$0.004/min

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

30 días

76 idiomas

(ver todos)

Detección automáticaDiarización
CS
+1
TranscribirVer Benchmarks
Scribe v2 Realtime

ElevenLabs

Tiempo real
Estados Unidos

STT de baja latencia más preciso — <150ms, más de 90 idiomas

$0.0065/min

TTFW (P50)

2084 ms

Factor de Velocidad

0.0x

Facturación

cada 1s

Retención

30 días

76 idiomas

(ver todos)

streamingDetección automática
CS
+2
TranscribirVer Benchmarks
Gladia Solaria-1 (Realtime)

Gladia

Tiempo real
EU (France)

Gladia Solaria-1 — reconocimiento de voz por streaming en tiempo real alojado en la UE para más de 100 idiomas con cambio de idioma nativo y latencia parcial de ~103ms. Marcas de tiempo por palabra e identificación automática de idioma; la diarización de hablantes está disponible por lotes (Solaria-3), no en este modelo de streaming.

$0.0125/min

TTFW (P50)

1332 ms

Factor de Velocidad

0.2x

Facturación

cada 1s

Retención

Sin retención

25 idiomas

(ver todos)

streamingDetección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Gladia Solaria-3

Gladia

Por lotes
EU (France)

Gladia Solaria-3 — reconocimiento de voz por lotes alojado en la UE optimizado para la máxima precisión en audio empresarial en cinco idiomas europeos principales (inglés, francés, alemán, español, italiano), con diarización de hablantes, vocabulario personalizado y marcas de tiempo por palabra.

$0.0101/min
Mejor Legal

WER

10.13%

CER

6.26%

Factor de Velocidad

0.2x

Facturación

cada 1s

Retención

Sin retención

5 idiomas

(ver todos)

Detección automáticaDiarizaciónMarcas de tiempo por palabra+1
TranscribirVer Benchmarks
Speechmatics Standard

Speechmatics

Por lotes
Europa

Modelo económico — respuesta rápida, más de 55 idiomas

$0.005/min

WER

20.05%

CER

12.68%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

48 idiomas

(ver todos)

API asíncronaDetección automáticaDiarización+3
TranscribirVer Benchmarks
Google Telephony

Google Cloud

Por lotes
Estados Unidos

Optimizado para audio de telefonía (8kHz)

$0.016/min

WER

22.85%

CER

13.22%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 15s

Retención

Personalizada

9 idiomas

(ver todos)

Marcas de tiempo por palabra
TranscribirVer Benchmarks
Amazon Transcribe

Amazon Web Services

Por lotes
Estados Unidos

ASR impulsado por modelos fundacionales de AWS — más de 100 idiomas

$0.006/min
Más Preciso

WER

4.71%

CER

2.53%

Factor de Velocidad

0.4x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Personalizada

77 idiomas

(ver todos)

API asíncronaDetección automáticaDiarización+2
TranscribirVer Benchmarks
Amazon Transcribe Medical

Amazon Web Services

Por lotes
Estados Unidos

Transcripción médica con elegibilidad HIPAA

$0.075/min
Mejor Ruidoso
Mejor Técnico

WER

25.73%

CER

17.32%

Factor de Velocidad

0.4x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Personalizada

1 idiomas

(ver todos)

Compatible con HIPAAAPI asíncronaDiarización+2
TranscribirVer Benchmarks
Universal-3 Pro

AssemblyAI

Por lotes
Estados Unidos

El modelo de lenguaje de voz más potente de AssemblyAI — hasta 1000 frases clave

$0.0035/min

WER

17.30%

CER

9.93%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

6 idiomas

(ver todos)

Detección automáticaDiarización
CS
+2
TranscribirVer Benchmarks
Universal Streaming

AssemblyAI

Tiempo real
Estados Unidos

Diseñado para agentes de voz en tiempo real — transcripciones inmutables en ~300ms

$0.0025/min

TTFW (P50)

1277 ms

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

streamingMarcas de tiempo por palabra
TranscribirVer Benchmarks
Universal Streaming Multilingual

AssemblyAI

Tiempo real
Estados Unidos

STT en streaming multilingüe — inglés, español, francés, alemán, italiano, portugués

$0.0025/min

TTFW (P50)

1469 ms

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

6 idiomas

(ver todos)

streaming
CS
Marcas de tiempo por palabra
TranscribirVer Benchmarks
Voxtral Mini Transcribe

Mistral (Voxtral)

Por lotes
France

Voxtral Mini Transcribe de Mistral — transcripción por lotes alojada en la UE con diarización de hablantes, marcas de tiempo por segmento y vocabulario personalizado (context bias). Buena precisión a muy bajo costo; admite grabaciones de hasta 3 horas.

$0.003/min
Mejor Relación
Más Rápido
Opción Económica
+1

WER

8.86%

CER

5.30%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

8 idiomas

(ver todos)

Detección automáticaDiarizaciónVocabulario personalizado
TranscribirVer Benchmarks
Whisper 1 (API)

OpenAI

Por lotes
Estados Unidos

Modelo Whisper API de OpenAI

$0.006/min

WER

17.63%

CER

13.03%

Factor de Velocidad

0.3x

Facturación

cada 1s

Retención

Sin retención

98 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Whisper Large V3

Groq

Por lotes
Estados Unidos

Whisper large-v3 de OpenAI ejecutado en el hardware LPU de Groq — la mejor precisión de Whisper a la velocidad y el costo de Groq, con marcas de tiempo por palabra y detección automática de idioma.

$0.0019/min

Factor de Velocidad

0.0x

Facturación

cada 1s

Retención

Sin retención

12 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Whisper Large V3

OpenAI

Por lotes
Estados Unidos

Modelo Whisper large-v3 de OpenAI

$0.006/min

WER

18.81%

CER

15.54%

Factor de Velocidad

0.3x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

98 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Whisper Large V3 Turbo

Groq

Por lotes
Estados Unidos

Whisper large-v3-turbo de OpenAI ejecutado en el hardware LPU de Groq — transcripción por lotes muy rápida y de muy bajo costo, con marcas de tiempo por palabra y detección automática de idioma.

$0.0007/min

Factor de Velocidad

0.0x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

12 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks