1,205
±119 95% CI
64%
Win rate
72
Battles
Pairwise preference rankings and independent benchmarks for leading speech models.
Valid votes
190
Models
6
Method
Bradley–Terry MLE
Models are ordered by rating. Models are marked preliminary until 200 valid battles; disabled models are hidden. Newly added models appear unranked at the bottom until they record their first battles.
Controls only for which response was heard first.
1,205
±119 95% CI
64%
Win rate
72
Battles
1,183
±129 95% CI
61%
Win rate
52
Battles
1,123
±119 95% CI
52%
Win rate
65
Battles
1,115
±113 95% CI
50%
Win rate
61
Battles
1,037
±99 95% CI
39%
Win rate
66
Battles
1,000
±0 95% CI
33%
Win rate
63
Battles
Win rate per language. Cells with too few battles are left blank.
| Model | English |
|---|---|
| Google Gemini 2.5 Flash Native Audio | 66% |
| OpenAI GPT Realtime | 54% |
| OpenAI GPT-4o Audio | 50% |
| OpenAI GPT Realtime 1.5 | 57% |
| xAI Grok Voice | 38% |
| Alibaba Qwen3-Omni Flash | 31% |