Realtime ranker
Every realtime model. Same audio. Scored on responsiveness, stability, and accuracy — the axes that matter when words appear as you speak.
10 free transcriptions, up to 2 hours on signup — no card.
17
Models Ranked
505
Total Benchmarks
11
Languages Tested
Jul 28, 2026
Last Updated
01 · Leader
Universal-3.5 Pro Realtime
AssemblyAI
81.7
Score
TTFW
1008 ms
Flicker
15.7%
WER
8.92%
02 · Runner-up
Flux
Deepgram
79.4
Score
TTFW
289 ms
Flicker
53.3%
WER
19.57%
03 · Third
Nova-3
Deepgram
78.2
Score
TTFW
973 ms
Flicker
9.6%
WER
18.17%
01
Universal-3.5 Pro Realtime
81.7
1008 ms TTFW
15.7% flicker
109 ms drain
8.92% WER
02
Flux
79.4
289 ms TTFW
53.3% flicker
0 ms drain
19.57% WER
03
Nova-3
78.2
973 ms TTFW
9.6% flicker
181 ms drain
18.17% WER
04
Nova-2
78.0
986 ms TTFW
10.5% flicker
192 ms drain
18.08% WER
05
Nova-2 Phone Call
77.8
975 ms TTFW
9.0% flicker
186 ms drain
19.26% WER
06
Ink-2
77.6
1554 ms TTFW
0.0% flicker
180 ms drain
14.85% WER
07
Nova-2 Conversational AI
77.4
1013 ms TTFW
10.5% flicker
185 ms drain
18.80% WER
08
Nova-2 Voicemail
77.2
1014 ms TTFW
10.1% flicker
194 ms drain
19.27% WER
09
Universal Streaming
75.9
1269 ms TTFW
3.9% flicker
806 ms drain
19.11% WER
10
Nova-2 Meeting
75.9
1016 ms TTFW
13.6% flicker
224 ms drain
20.83% WER
11
Nova-2 Finance
75.7
1014 ms TTFW
12.1% flicker
191 ms drain
21.82% WER
12
Universal Streaming Multilingual
73.4
1496 ms TTFW
2.8% flicker
791 ms drain
21.60% WER
13
Azure Speech
72.4
2052 ms TTFW
13.2% flicker
0 ms drain
15.82% WER
14
Soniox STT Realtime
71.6
1459 ms TTFW
66.5% flicker
0 ms drain
12.25% WER
15
Scribe v2 Realtime
68.9
2113 ms TTFW
57.9% flicker
302 ms drain
11.60% WER
16
Gladia Solaria-1 (Realtime)
68.2
1372 ms TTFW
89.9% flicker
191 ms drain
16.89% WER
17
Ink-Whisper
67.1
4992 ms TTFW
0.0% flicker
164 ms drain
18.19% WER
50%
Accuracy
WER vs. reference transcripts, streamed live
25%
Responsiveness
Median time to first word shown, partial or final
20%
Stability
How often earlier partials get revised before finalizing
5%
Tail latency
Final-chunk drain time after audio stops
WER
Word Error Rate
Accuracy of the streamed transcript vs. the reference — the 50% anchor of the realtime score, same measure as the batch board (lower is better)
TTFW
Time to First Word
How quickly the model starts showing words (lower is better)
Flicker
Flicker
How often earlier partial words change before the transcript finalizes (lower is better)
Cadence
Cadence
How often the model updates its partial transcript — descriptive context, not scored
RTF
Real-Time Factor
Reads ≈1.0 for a well-behaved realtime model since audio is streamed at real-time pace — not a 'lower is always better' metric like batch speed factor
Corpus sources & licenses
The golden set is built from openly-licensed audio. LibriSpeech and FLEURS are CC BY 4.0 and require attribution; the rest is credited for transparency.
LibriSpeech (test-clean) — CC BY 4.0
Mozilla Common Voice — CC0 1.0
Bangor Miami (TalkBank) — GPLv3
Spoken Wikipedia CS Corpus — CC BY-SA 3.0
U.S. government recordings (SCOTUS, NIH/CDC) — Public domain
Original recordings — OpenTranscription
One endpoint, every provider. Pin the leader or let us auto-route to the best model under your accuracy and latency budget.