OpenTranscription
OpenTranscription
RankerModelosPlayground
OpenTranscription
OpenTranscription

Una API para cada modelo de voz a texto que vale la pena. Compáralos con tu audio, enruta al mejor, paga por segundo.

Estado de la plataforma

Producto

ClasificadorModelosTranscripcionesPlaygroundBlog

Desarrolladores

DocumentaciónConfiabilidadVersionado APIEstado

Legal

Política de PrivacidadTérminos de ServicioSoporte
© 2026 OpenTranscription

Catálogo · 43 modelos · 15 proveedores

Modelos de transcripción.

Todos los modelos de voz a texto que valen la pena, una sola tarifa.

Rango de Precio

$0.0007

$0.075

Cumplimiento

Funciones

Mejor para:

43

Modelos totales

105

Idiomas

$0.0007

Más barato /min

8.7%

Mejor WER

43 modelos

Base

Deepgram

Por lotes
Estados Unidos

Modelo Base de Deepgram — alto volumen, económico

$0.0145/min

WER

25.04%

CER

18.09%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

19 idiomas

(ver todos)

Detección automáticaDiarizaciónMarcas de tiempo por palabra+1
TranscribirVer Benchmarks
Chirp 3

Google Cloud

Por lotes
Estados Unidos

Último modelo fundacional ASR generativo de Google — más de 85 idiomas

$0.0107/min
Mejor Conversacional
Mejor Acentuado

WER

9.95%

CER

5.81%

Factor de Velocidad

0.3x

Disponibilidad

66.7%

Facturación

cada 15s

Retención

Personalizada

68 idiomas

(ver todos)

GenerativoDetección automáticaDiarización+2
TranscribirVer Benchmarks
Google Command & Search

Google Cloud

Por lotes
Estados Unidos

Optimizado para consultas cortas y comandos de voz

$0.016/min

WER

35.22%

CER

26.46%

Factor de Velocidad

0.1x

Facturación

cada 15s

Retención

Personalizada

40 idiomas

(ver todos)

Marcas de tiempo por palabra
TranscribirVer Benchmarks
Google Default

Google Cloud

Por lotes
Estados Unidos

Modelo de propósito general

$0.016/min

WER

34.65%

CER

25.66%

Factor de Velocidad

0.2x

Facturación

cada 15s

Retención

Personalizada

40 idiomas

(ver todos)

DiarizaciónMarcas de tiempo por palabra
TranscribirVer Benchmarks
Speechmatics Enhanced

Speechmatics

Por lotes
Europa

Modelo de mayor precisión — más de 55 idiomas, el mejor de su clase

$0.0083/min

WER

12.30%

CER

7.96%

Factor de Velocidad

0.3x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

48 idiomas

(ver todos)

API asíncronaDetección automáticaDiarización+3
TranscribirVer Benchmarks
Enhanced

Deepgram

Por lotes
Estados Unidos

Modelo Enhanced de Deepgram — alta precisión para palabras poco comunes

$0.0165/min

WER

24.86%

CER

14.27%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

15 idiomas

(ver todos)

Detección automáticaDiarizaciónMarcas de tiempo por palabra+1
TranscribirVer Benchmarks
Flux

Deepgram

Tiempo real
Estados Unidos

Primer modelo ASR conversacional para agentes de voz — endpointing integrado en el modelo

$0.0077/min

TTFW (P50)

289 ms

Factor de Velocidad

0.1x

Disponibilidad

85.7%

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

endpointing
CS
turn detection+1
TranscribirVer Benchmarks
GPT-4o Mini Transcribe

OpenAI

Por lotes
Estados Unidos

GPT-4o Mini optimizado para transcripción rápida

$0.003/min

WER

13.58%

CER

9.32%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

98 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
GPT-4o Transcribe

OpenAI

Por lotes
Estados Unidos

GPT-4o optimizado para transcripción con WER mejorado

$0.006/min

WER

14.76%

CER

11.60%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

98 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
GPT-4o Transcribe Diarize

OpenAI

Por lotes
Estados Unidos

Transcripción GPT-4o con diarización de hablantes integrada

$0.006/min

WER

14.61%

CER

9.97%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

12 idiomas

(ver todos)

Detección automáticaDiarización
TranscribirVer Benchmarks
Ink-2

Cartesia

Tiempo real
Estados Unidos

El nuevo STT en streaming de Cartesia — el menor WER de cualquier modelo en streaming, detección de turnos nativa y precisión en datos alfanuméricos como números de teléfono, correos y UUID. Por ahora solo en inglés.

$0.0065/min

TTFW (P50)

1554 ms

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

streamingendpointingturn detection+1
TranscribirVer Benchmarks
Ink-Whisper

Cartesia

Lotes y Tiempo real
Estados Unidos

Whisper rediseñado para IA de voz en tiempo real y por lotes — TTCT más rápido, cobertura en 99 idiomas

$0.0022/min

WER

17.20%

CER

11.58%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

100 idiomas

(ver todos)

Marcas de tiempo por palabradynamic chunking
TranscribirVer Benchmarks
Google Latest (Long)

Google Cloud

Por lotes
Estados Unidos

Modelo Conformer para audio de larga duración (minutos a horas)

$0.0107/min

WER

22.55%

CER

13.81%

Factor de Velocidad

0.4x

Disponibilidad

100.0%

Facturación

cada 15s

Retención

Personalizada

40 idiomas

(ver todos)

Marcas de tiempo por palabra
TranscribirVer Benchmarks
Google Latest (Short)

Google Cloud

Por lotes
Estados Unidos

Modelo Conformer para enunciados cortos (< 60s)

$0.016/min

WER

57.82%

CER

52.44%

Factor de Velocidad

0.1x

Facturación

cada 15s

Retención

Personalizada

40 idiomas

(ver todos)

Marcas de tiempo por palabra
TranscribirVer Benchmarks
Nova-2

Deepgram

Lotes y Tiempo real
Estados Unidos

Reconocimiento de voz Nova-2 de Deepgram

$0.0058/min
Más Rápido

WER

16.54%

CER

11.93%

Factor de Velocidad

0.1x

Disponibilidad

83.3%

Facturación

cada 1s

Retención

Sin retención

33 idiomas

(ver todos)

Detección automáticaDiarización
CS
+2
TranscribirVer Benchmarks
Nova-2 Conversational AI

Deepgram

Lotes y Tiempo real
Estados Unidos

Optimizado para interacciones humano-bot (IVR, asistentes de voz)

$0.0058/min

WER

18.23%

CER

13.27%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

Diarización
CS
Marcas de tiempo por palabra+1
TranscribirVer Benchmarks
Nova-2 Finance

Deepgram

Lotes y Tiempo real
Obsoleto
Estados Unidos

Optimizado para llamadas de resultados con vocabulario financiero

$0.0058/min

WER

18.92%

CER

13.09%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

Diarización
CS
Marcas de tiempo por palabra+1
TranscribirVer Benchmarks
Nova-2 Meeting

Deepgram

Lotes y Tiempo real
Estados Unidos

Optimizado para audio de salas de conferencias

$0.0058/min

WER

16.74%

CER

11.73%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

Diarización
CS
Marcas de tiempo por palabra+1
TranscribirVer Benchmarks
Nova-2 Phone Call

Deepgram

Lotes y Tiempo real
Estados Unidos

Optimizado para audio de llamadas telefónicas de bajo ancho de banda

$0.0058/min

WER

16.38%

CER

12.42%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

Diarización
CS
Marcas de tiempo por palabra+1
TranscribirVer Benchmarks
Nova-2 Voicemail

Deepgram

Lotes y Tiempo real
Estados Unidos

Optimizado para buzón de voz de un solo hablante de bajo ancho de banda

$0.0058/min

WER

17.51%

CER

12.36%

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

CS
Marcas de tiempo por palabraVocabulario personalizado
TranscribirVer Benchmarks
Nova-3

Deepgram

Lotes y Tiempo real
Estados Unidos

Modelo insignia de Deepgram — 53% menos WER vs competidores, soporte de cambio de código

$0.0077/min
Mejor Ruidoso
Mejor Técnico

WER

20.98%

CER

11.48%

Factor de Velocidad

0.1x

Disponibilidad

50.0%

Facturación

cada 1s

Retención

Sin retención

47 idiomas

(ver todos)

Detección automáticaDiarizaciónFormato inteligente+3
TranscribirVer Benchmarks
Qwen3 ASR Flash

Alibaba (Qwen)

Por lotes
Singapore

Qwen3-ASR Flash de Alibaba — transcripción por lotes multilingüe (más de 25 idiomas) con marcas de tiempo por palabra y detección automática de idioma, alojado en Model Studio (Singapur). Admite archivos de hasta 12 horas.

$0.0021/min

WER

12.27%

CER

7.39%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

25 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Rev AI Reverb

Rev AI

Por lotes
Estados Unidos

Rev AI Reverb — reconocimiento de voz asíncrono basado en el modelo Reverb ASR de Rev (entrenado con más de 3 millones de horas de audio transcrito por humanos), con diarización de hasta 8 hablantes y marcas de tiempo por palabra. Núcleo en inglés con amplio soporte de idiomas a través de la API asíncrona.

$0.003/min

WER

18.18%

CER

13.46%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

20 idiomas

(ver todos)

DiarizaciónMarcas de tiempo por palabra
TranscribirVer Benchmarks
Scribe v2

ElevenLabs

Por lotes
Estados Unidos

STT por lotes de última generación — más de 90 idiomas, diarización de hablantes, etiquetado de audio

$0.004/min

WER

9.15%

CER

7.19%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

30 días

76 idiomas

(ver todos)

Detección automáticaDiarización
CS
+1
TranscribirVer Benchmarks
Scribe v2 Realtime

ElevenLabs

Tiempo real
Estados Unidos

STT de baja latencia más preciso — <150ms, más de 90 idiomas

$0.0065/min

TTFW (P50)

2113 ms

Factor de Velocidad

0.0x

Facturación

cada 1s

Retención

30 días

76 idiomas

(ver todos)

streamingDetección automática
CS
+2
TranscribirVer Benchmarks
Gladia Solaria-1 (Realtime)

Gladia

Tiempo real
EU (France)

Gladia Solaria-1 — reconocimiento de voz por streaming en tiempo real alojado en la UE para más de 100 idiomas con cambio de idioma nativo y latencia parcial de ~103ms. Marcas de tiempo por palabra e identificación automática de idioma; la diarización de hablantes está disponible por lotes (Solaria-3), no en este modelo de streaming.

$0.0125/min

TTFW (P50)

1372 ms

Factor de Velocidad

0.2x

Facturación

cada 1s

Retención

Sin retención

25 idiomas

(ver todos)

streamingDetección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Gladia Solaria-3

Gladia

Por lotes
EU (France)

Gladia Solaria-3 — reconocimiento de voz por lotes alojado en la UE optimizado para la máxima precisión en audio empresarial en cinco idiomas europeos principales (inglés, francés, alemán, español, italiano), con diarización de hablantes, vocabulario personalizado y marcas de tiempo por palabra.

$0.0101/min
Mejor Legal

WER

9.80%

CER

5.76%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

5 idiomas

(ver todos)

Detección automáticaDiarizaciónMarcas de tiempo por palabra+1
TranscribirVer Benchmarks
Azure Speech

Microsoft Azure

Lotes y Tiempo real
Estados Unidos

Modelo STT predeterminado de Azure — más de 140 idiomas, diarización, marcas de tiempo por palabra

$0.006/min

WER

15.34%

CER

10.67%

Factor de Velocidad

0.3x

Facturación

cada 60s

Retención

Personalizada

19 idiomas

(ver todos)

DiarizaciónMarcas de tiempo por palabra
TranscribirVer Benchmarks
Speechmatics Standard

Speechmatics

Por lotes
Europa

Modelo económico — respuesta rápida, más de 55 idiomas

$0.005/min

WER

14.69%

CER

9.80%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

48 idiomas

(ver todos)

API asíncronaDetección automáticaDiarización+3
TranscribirVer Benchmarks
Soniox STT (Async)

Soniox

Por lotes
Estados Unidos

Transcripción por lotes asíncrona de Soniox — un modelo multilingüe para más de 60 idiomas con diarización de hablantes, marcas de tiempo por palabra e identificación automática de idioma, a una tarifa baja basada en tokens.

$0.0017/min

WER

8.73%

CER

6.18%

Factor de Velocidad

0.1x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

25 idiomas

(ver todos)

Detección automáticaDiarizaciónMarcas de tiempo por palabra
TranscribirVer Benchmarks
Soniox STT Realtime

Soniox

Tiempo real
Estados Unidos

Transcripción en tiempo real de Soniox — STT multilingüe de baja latencia para más de 60 idiomas con diarización de hablantes, marcas de tiempo por palabra e identificación automática de idioma a través de un único WebSocket.

$0.002/min

TTFW (P50)

1459 ms

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

25 idiomas

(ver todos)

Detección automáticaDiarizaciónMarcas de tiempo por palabra
TranscribirVer Benchmarks
Google Telephony

Google Cloud

Por lotes
Estados Unidos

Optimizado para audio de telefonía (8kHz)

$0.016/min

WER

20.24%

CER

12.59%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 15s

Retención

Personalizada

9 idiomas

(ver todos)

Marcas de tiempo por palabra
TranscribirVer Benchmarks
Amazon Transcribe

Amazon Web Services

Por lotes
Estados Unidos

ASR impulsado por modelos fundacionales de AWS — más de 100 idiomas

$0.006/min
Más Preciso

WER

13.02%

CER

9.17%

Factor de Velocidad

0.4x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Personalizada

77 idiomas

(ver todos)

API asíncronaDetección automáticaDiarización+2
TranscribirVer Benchmarks
Amazon Transcribe Medical

Amazon Web Services

Por lotes
Estados Unidos

Transcripción médica con elegibilidad HIPAA

$0.075/min

WER

14.92%

CER

9.67%

Factor de Velocidad

0.4x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Personalizada

1 idiomas

(ver todos)

Compatible con HIPAAAPI asíncronaDiarización+2
TranscribirVer Benchmarks
Universal-3.5 Pro Realtime

AssemblyAI

Tiempo real
Estados Unidos

AssemblyAI Universal-3.5 Pro Realtime — el modelo de streaming insignia, con cambio de idioma nativo a mitad de frase en 18 idiomas y contexto de conversación mantenido entre turnos. Marcas de tiempo por palabra y resultados parciales estables que no se reescriben conforme llegan; la diarización de hablantes está disponible en el modelo por lotes, no en este de streaming.

$0.0075/min

TTFW (P50)

1008 ms

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

18 idiomas

(ver todos)

streamingDetección automática
CS
+1
TranscribirVer Benchmarks
Universal-3.5 Pro

AssemblyAI

Por lotes
Estados Unidos

El modelo de lenguaje de voz más potente de AssemblyAI — hasta 1000 frases clave

$0.0035/min

WER

17.44%

CER

10.37%

Factor de Velocidad

0.2x

Disponibilidad

88.9%

Facturación

cada 1s

Retención

Sin retención

6 idiomas

(ver todos)

Detección automáticaDiarización
CS
+2
TranscribirVer Benchmarks
Universal Streaming

AssemblyAI

Tiempo real
Estados Unidos

Diseñado para agentes de voz en tiempo real — transcripciones inmutables en ~300ms

$0.0025/min

TTFW (P50)

1269 ms

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

1 idiomas

(ver todos)

streamingMarcas de tiempo por palabra
TranscribirVer Benchmarks
Universal Streaming Multilingual

AssemblyAI

Tiempo real
Estados Unidos

STT en streaming multilingüe — inglés, español, francés, alemán, italiano, portugués

$0.0025/min

TTFW (P50)

1496 ms

Factor de Velocidad

0.1x

Facturación

cada 1s

Retención

Sin retención

6 idiomas

(ver todos)

streaming
CS
Marcas de tiempo por palabra
TranscribirVer Benchmarks
Voxtral Mini Transcribe

Mistral (Voxtral)

Por lotes
France

Voxtral Mini Transcribe de Mistral — transcripción por lotes alojada en la UE con diarización de hablantes, marcas de tiempo por segmento y vocabulario personalizado (context bias). Buena precisión a muy bajo costo; admite grabaciones de hasta 3 horas.

$0.003/min
Mejor Relación
Opción Económica

WER

12.70%

CER

7.97%

Factor de Velocidad

0.2x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

8 idiomas

(ver todos)

Detección automáticaDiarizaciónVocabulario personalizado
TranscribirVer Benchmarks
Whisper 1 (API)

OpenAI

Por lotes
Estados Unidos

Modelo Whisper API de OpenAI

$0.006/min

WER

17.63%

CER

13.03%

Factor de Velocidad

0.3x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

98 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Whisper Large V3

Groq

Por lotes
Estados Unidos

Whisper large-v3 de OpenAI ejecutado en el hardware LPU de Groq — la mejor precisión de Whisper a la velocidad y el costo de Groq, con marcas de tiempo por palabra y detección automática de idioma.

$0.0019/min

WER

14.41%

CER

11.20%

Factor de Velocidad

0.0x

Facturación

cada 1s

Retención

Sin retención

12 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Whisper Large V3

OpenAI

Por lotes
Estados Unidos

Modelo Whisper large-v3 de OpenAI

$0.006/min
Mejor Médico

WER

17.67%

CER

13.06%

Factor de Velocidad

0.3x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

98 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks
Whisper Large V3 Turbo

Groq

Por lotes
Estados Unidos

Whisper large-v3-turbo de OpenAI ejecutado en el hardware LPU de Groq — transcripción por lotes muy rápida y de muy bajo costo, con marcas de tiempo por palabra y detección automática de idioma.

$0.0007/min

WER

14.31%

CER

10.63%

Factor de Velocidad

0.0x

Disponibilidad

100.0%

Facturación

cada 1s

Retención

Sin retención

12 idiomas

(ver todos)

Detección automáticaMarcas de tiempo por palabra
TranscribirVer Benchmarks

Todas las comparaciones de modelos

Cada comparación que indexamos, agrupada por modelo.

Chirp 3

vs Voxtral Mini Transcribevs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs Whisper Large V3 Turbovs Whisper Large V3 (Groq)vs GPT-4o Transcribe Diarizevs Speechmatics Standard

Nova-3

vs Chirp 3vs Voxtral Mini Transcribevs Gladia Solaria-3vs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Scribe v2vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs Whisper Large V3 Turbovs Whisper Large V3 (Groq)vs GPT-4o Transcribe Diarizevs Speechmatics Standard

Gladia Solaria-3

vs Chirp 3vs Voxtral Mini Transcribevs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs Whisper Large V3 Turbovs Whisper Large V3 (Groq)vs GPT-4o Transcribe Diarizevs Speechmatics Standard

Amazon Transcribe

vs Chirp 3vs Voxtral Mini Transcribevs Nova-3vs Gladia Solaria-3vs Nova-2vs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Scribe v2vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs Whisper Large V3 Turbovs Whisper Large V3 (Groq)vs GPT-4o Transcribe Diarizevs Speechmatics Standard

Nova-2

vs Chirp 3vs Voxtral Mini Transcribevs Nova-3vs Gladia Solaria-3vs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Scribe v2vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs Whisper Large V3 Turbovs Whisper Large V3 (Groq)vs GPT-4o Transcribe Diarizevs Speechmatics Standard

Scribe v2

vs Chirp 3vs Voxtral Mini Transcribevs Gladia Solaria-3vs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs Whisper Large V3 Turbovs Whisper Large V3 (Groq)vs GPT-4o Transcribe Diarizevs Speechmatics Standard

Qwen3 ASR Flash

vs Chirp 3vs Voxtral Mini Transcribevs Nova-3vs Gladia Solaria-3vs Amazon Transcribevs Nova-2vs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Scribe v2vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs Whisper Large V3 Turbovs Whisper Large V3 (Groq)vs GPT-4o Transcribe Diarizevs Speechmatics Standard

Voxtral Mini Transcribe

vs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs GPT-4o Transcribe Diarizevs Speechmatics Standard

Whisper Large V3 Turbo

vs Voxtral Mini Transcribevs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs GPT-4o Transcribe Diarizevs Speechmatics Standard

Whisper Large V3 (Groq)

vs Voxtral Mini Transcribevs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Speechmatics Enhancedvs GPT-4o Mini Transcribevs Whisper Large V3 Turbovs GPT-4o Transcribe Diarizevs Speechmatics Standard

Whisper Large V3 (OpenAI)

vs Soniox STT (Async)vs Speechmatics Enhancedvs Speechmatics Standard

GPT-4o Mini Transcribe

vs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Speechmatics Enhancedvs GPT-4o Transcribe Diarizevs Speechmatics Standard

GPT-4o Transcribe Diarize

vs Whisper Large V3 (OpenAI)vs Soniox STT (Async)vs Speechmatics Enhancedvs Speechmatics Standard

Soniox STT (Async)

vs Speechmatics Enhancedvs Speechmatics Standard

Speechmatics Enhanced

vs Speechmatics Standard

Del blog

Análisis a fondo sobre precisión, latencia y precios en transcripción de voz (en inglés).

Ver todas las entradas
Amazon Transcribe Medical: what AWS actually ships, and what it won't tell you

What Amazon Transcribe Medical offers in 2026: features, specs, pricing vs Google and Nuance, HIPAA posture, research clues, and where it falls short.

Chirp 3: inside Google Cloud's 2025 speech stack, from HD voices to transcription

What Google Cloud Chirp 3 actually is: release timeline, WER and Elo benchmarks, pricing, specs, known issues, and how it compares to Azure and ElevenLabs.

Deepgram Base in 2026: what the legacy model still does well

Where Deepgram Base fits in 2026: API behavior, variants, latency, specs, limitations, and when to pick Nova-3 or Flux instead.