1,133
±164 95% CI
57%
Win rate
21
Battles
Pairwise preference rankings and independent benchmarks for leading speech models.
Valid votes
67
Models
6
Method
Bradley–Terry MLE
Models are ordered by rating. Models are marked preliminary until 200 valid battles; disabled models are hidden. Newly added models appear unranked at the bottom until they record their first battles.
Controls only for which response was heard first.
1,133
±164 95% CI
57%
Win rate
21
Battles
1,113
±160 95% CI
54%
Win rate
34
Battles
1,090
±153 95% CI
50%
Win rate
31
Battles
1,041
±144 95% CI
44%
Win rate
18
Battles
1,000
±0 95% CI
35%
Win rate
30
Battles
—
—
Win rate
0
No battles yet
Win rate per language. Cells with too few battles are left blank.
| Model | English |
|---|---|
| Mistral Voxtral Small | 52% |
| OpenAI GPT-4o Audio | 52% |
| Alibaba Qwen3-Omni Flash | 36% |