OpenTranscription
OpenTranscription
RankerModelsPlayground
OpenTranscription
OpenTranscription

One API to every speech-to-text model worth using. Compare them on your audio, route to the best one, pay per second.

Platform status

Product

RankerModelsTranscriptionsPlaygroundBlog

Developers

DocumentationReliabilityAPI VersioningStatus

Legal

Privacy PolicyTerms of ServiceSupport
© 2026 OpenTranscription

Realtime ranker

Streaming transcription, ranked.

Every realtime model. Same audio. Scored on responsiveness, stability, and accuracy — the axes that matter when words appear as you speak.

Start freeOpen playground

10 free transcriptions, up to 2 hours on signup — no card.

17

Models Ranked

505

Total Benchmarks

11

Languages Tested

Jul 28, 2026

Last Updated

01 · Leader

Universal-3.5 Pro Realtime

AssemblyAI

81.7

Score

TTFW

1008 ms

Flicker

15.7%

WER

8.92%

02 · Runner-up

Flux

Deepgram

79.4

Score

TTFW

289 ms

Flicker

53.3%

WER

19.57%

03 · Third

Nova-3

Deepgram

78.2

Score

TTFW

973 ms

Flicker

9.6%

WER

18.17%

#ModelScoreTTFWFlickerDrainWERRuns

01

Universal-3.5 Pro Realtime

AssemblyAI

81.7

1008 ms

15.7%

109 ms

8.92%

33

02

Flux

Deepgram

79.4

289 ms

53.3%

0 ms

19.57%

25

03

Nova-3

Deepgram

78.2

973 ms

9.6%

181 ms

18.17%

34

04

Nova-2

Deepgram

78.0

986 ms

10.5%

192 ms

18.08%

34

05

Nova-2 Phone Call

Deepgram

77.8

975 ms

9.0%

186 ms

19.26%

25

06

Ink-2

Cartesia

77.6

1554 ms

0.0%

180 ms

14.85%

25

07

Nova-2 Conversational AI

Deepgram

77.4

1013 ms

10.5%

185 ms

18.80%

25

08

Nova-2 Voicemail

Deepgram

77.2

1014 ms

10.1%

194 ms

19.27%

25

09

Universal Streaming

AssemblyAI

75.9

1269 ms

3.9%

806 ms

19.11%

25

10

Nova-2 Meeting

Deepgram

75.9

1016 ms

13.6%

224 ms

20.83%

25

11

Nova-2 Finance

Deepgram

75.7

1014 ms

12.1%

191 ms

21.82%

25

12

Universal Streaming Multilingual

AssemblyAI

73.4

1496 ms

2.8%

791 ms

21.60%

29

13

Azure Speech

Microsoft Azure

72.4

2052 ms

13.2%

0 ms

15.82%

35

14

Soniox STT Realtime

Soniox

71.6

1459 ms

66.5%

0 ms

12.25%

35

15

Scribe v2 Realtime

ElevenLabs

68.9

2113 ms

57.9%

302 ms

11.60%

35

16

Gladia Solaria-1 (Realtime)

Gladia

68.2

1372 ms

89.9%

191 ms

16.89%

35

17

Ink-Whisper

Cartesia

67.1

4992 ms

0.0%

164 ms

18.19%

35

01

Universal-3.5 Pro Realtime

81.7

1008 ms TTFW

15.7% flicker

109 ms drain

8.92% WER

02

Flux

79.4

289 ms TTFW

53.3% flicker

0 ms drain

19.57% WER

03

Nova-3

78.2

973 ms TTFW

9.6% flicker

181 ms drain

18.17% WER

04

Nova-2

78.0

986 ms TTFW

10.5% flicker

192 ms drain

18.08% WER

05

Nova-2 Phone Call

77.8

975 ms TTFW

9.0% flicker

186 ms drain

19.26% WER

06

Ink-2

77.6

1554 ms TTFW

0.0% flicker

180 ms drain

14.85% WER

07

Nova-2 Conversational AI

77.4

1013 ms TTFW

10.5% flicker

185 ms drain

18.80% WER

08

Nova-2 Voicemail

77.2

1014 ms TTFW

10.1% flicker

194 ms drain

19.27% WER

09

Universal Streaming

75.9

1269 ms TTFW

3.9% flicker

806 ms drain

19.11% WER

10

Nova-2 Meeting

75.9

1016 ms TTFW

13.6% flicker

224 ms drain

20.83% WER

11

Nova-2 Finance

75.7

1014 ms TTFW

12.1% flicker

191 ms drain

21.82% WER

12

Universal Streaming Multilingual

73.4

1496 ms TTFW

2.8% flicker

791 ms drain

21.60% WER

13

Azure Speech

72.4

2052 ms TTFW

13.2% flicker

0 ms drain

15.82% WER

14

Soniox STT Realtime

71.6

1459 ms TTFW

66.5% flicker

0 ms drain

12.25% WER

15

Scribe v2 Realtime

68.9

2113 ms TTFW

57.9% flicker

302 ms drain

11.60% WER

16

Gladia Solaria-1 (Realtime)

68.2

1372 ms TTFW

89.9% flicker

191 ms drain

16.89% WER

17

Ink-Whisper

67.1

4992 ms TTFW

0.0% flicker

164 ms drain

18.19% WER

How the realtime score is built

weighted composite

50%

Accuracy

WER vs. reference transcripts, streamed live

25%

Responsiveness

Median time to first word shown, partial or final

20%

Stability

How often earlier partials get revised before finalizing

5%

Tail latency

Final-chunk drain time after audio stops

Streaming metrics

how responsiveness is measured

WER

Word Error Rate

(Substitutions + Insertions + Deletions) ÷ Reference Words

Accuracy of the streamed transcript vs. the reference — the 50% anchor of the realtime score, same measure as the batch board (lower is better)

TTFW

Time to First Word

Time from audio start to first word shown, partial or final (P50)

How quickly the model starts showing words (lower is better)

Flicker

Flicker

Revised words ÷ total emitted words

How often earlier partial words change before the transcript finalizes (lower is better)

Cadence

Cadence

Partial emissions per second of audio

How often the model updates its partial transcript — descriptive context, not scored

RTF

Real-Time Factor

Processing time ÷ audio duration, at 1× playback pace

Reads ≈1.0 for a well-behaved realtime model since audio is streamed at real-time pace — not a 'lower is always better' metric like batch speed factor

Corpus sources & licenses

The golden set is built from openly-licensed audio. LibriSpeech and FLEURS are CC BY 4.0 and require attribution; the rest is credited for transparency.

LibriSpeech (test-clean) — CC BY 4.0

FLEURS — CC BY 4.0

Mozilla Common Voice — CC0 1.0

Earnings-21 — CC BY-SA 4.0

Bangor Miami (TalkBank) — GPLv3

Spoken Wikipedia CS Corpus — CC BY-SA 3.0

U.S. government recordings (SCOTUS, NIH/CDC) — Public domain

Original recordings — OpenTranscription

Route to whichever model wins.

One endpoint, every provider. Pin the leader or let us auto-route to the best model under your accuracy and latency budget.

Get started for freeRead the spec ↗