Modelo STT predeterminado de Azure — más de 140 idiomas, diarización, marcas de tiempo por palabra
19 idiomas · evaluado
Azure Speech es un modelo de transcripción de voz a texto de Microsoft Azure. En nuestras pruebas estandarizadas alcanza una tasa de error de palabra de 15.34%, ocupando el puesto n.º 16 de 34 modelos evaluados. Admite 19 idiomas y cuesta 0,006 US$/min — de precio intermedio.
Su alternativa evaluada más cercana es Soniox STT (Async). Ideal para subtitulado en vivo y transcripción en streaming y conversaciones con varios interlocutores.
Puntuación General
74.4
#16 de 34
Tasa de Error de Palabras
15.34%
Tasa de Error de Caracteres
10.67%
Tasa de Error de Coincidencia
14.88%
Información de Palabras Perdida
18.78%
Latencia Promedio
2.0s
Benchmarks Ejecutados
35
WER general · 34 modelos
Azure Speech
grupo · 33 modelos
abajo a la izquierda es mejor
8 categorías
WER
menor es mejor
Legal
1.7%
Médico
2.8%
Técnico
7.0%
Finanzas
7.1%
Conversacional
9.6%
General
10.5%
Ambiente Ruidoso
40.0%
Cambio de Código
60.1%
| Categoría | WER | CER | MER | WIL | Latencia | Evaluaciones |
|---|---|---|---|---|---|---|
Cambio de Código | 60.13% | 26.54% | 54.37% | 69.93% | 3.4s | 2 |
Conversacional | 9.58% | 6.22% | 9.58% | 11.69% | 2.4s | 2 |
Finanzas | 7.11% | 3.35% | 7.03% | 11.62% | 2.4s | 2 |
General | 10.55% | 8.84% | 10.32% | 14.17% | 1.8s | 19 |
Legal | 1.66% | 1.09% | 1.66% | 1.98% | 2.2s | 2 |
Médico | 2.75% | 1.44% | 2.75% | 4.17% | 2.2s | 2 |
Ambiente Ruidoso | 40.00% | 29.94% | 40.00% | 42.86% | 1.2s | 4 |
Técnico | 7.00% | 4.19% | 6.98% | 8.90% | 2.6s | 2 |
5 acentos
| Acento | WER | Evaluaciones |
|---|---|---|
Africano | 23.08% | 1 |
Australiano | 23.08% | 1 |
Indio | 41.27% | 1 |
Británico | 14.93% | 1 |
Estadounidense | 11.32% | 1 |
Puntuación en Tiempo Real
72.4
TTFW (P50)
2052 ms
Parpadeo
13.2%
Cadencia
1.7/s
RTF
1.01×
Tasa de Error de Palabras
15.82%
Tasa de Error de Caracteres
10.48%
Benchmarks Ejecutados
35
Tarifa
$0.006
/min
Facturación por segundo. Usa tu propia clave de proveedor y paga directamente al proveedor — se aplica una tarifa de enrutamiento del 5% (primeros 100 min/mes gratis).
Configurar BYOKEstimador de costo
1 hora
$0.36
10 horas
$3.60
100 horas
$36
1000 horas
$360
Facturado por segundo de audio procesado.
ID del modelo
azure/speech
Autentica cada solicitud con tu clave API secreta como token Bearer. Genera una clave desde tu panel.
Este modelo también admite streaming en tiempo real por WebSocket.
Úsalo con tu agente
Pega esto en Claude Code, Cursor, Codex o cualquier agente con terminal. Instala la CLI y la skill de OpenTranscription, y transcribe con este modelo.
Inicio rápido
Sube tu audio, crea un trabajo con este modelo y luego consulta el trabajo o define un webhook_url para recibir el aviso al completarse.
Parámetros clave
file_path
string
obligatorio
Ruta de almacenamiento devuelta por el paso de subida.
model
string
obligatorio
El modelo con el que se ejecuta este trabajo.
models
string[]
Cadena ordenada de respaldo: primero el principal y luego los alternativos, en orden, si un proveedor falla.
language
string
Código de idioma ISO 639-1. Omítelo para la detección automática.
diarization
boolean
Etiqueta a los hablantes (A, B, …) en el resultado.
word_timestamps
boolean
Inicio, fin y confianza por palabra. Por defecto es true; envía false para omitirlos.
webhook_url
string
URL HTTPS que recibe el resultado al completarse el trabajo. Los eventos entregados están firmados (X-OT-Signature).
title
string
Nombre visible de este trabajo en el panel. Si falta, se usa el nombre del archivo.
Respuesta
Un trabajo completado devuelve la transcripción en el Esquema Unificado de OpenTranscription (OTUS).
Webhooks — sin sondeo
Enviamos un evento firmado a tu webhook_url cuando un trabajo se completa o falla; verifica la cabecera X-OT-Signature (HMAC-SHA256, rechaza si tiene más de 300 s) y desduplicado por el id del evento, luego obtén la transcripción completa con GET /api/v1/transcriptions/{id}.
Límite por nivel — consulta los encabezados de respuesta X-RateLimit-*.
Referencia completa de la APIdel mismo grupo
Idiomas Soportados
Formatos Soportados
Características
Límites
Tamaño máx. de archivo
1 GB
Duración máx.
4 h