Open Speech Labs

Open evaluation and benchmarking for speech models.

Boards

Public boards

Compiled August 2026. Our own harness comes next.

TTS

Speech Arena Elo. Higher is better.

# Model Elo Kind
01 Simba 3.2 1239 API
02 Qwen-Audio-3.0-TTS-Plus 1237 API
03 Luna TTS 1219 API
04 Gemini 3.1 Flash TTS 1212 API
05 Sonic 3.5 1202 API
06 Eleven v3 1177 API
07 Fish Audio S2 Pro 1124 Open
08 Kokoro 82M 1059 Open

STT

Open ASR mean WER. Lower is better.

# Model WER Kind
01 ARK-ASR-3B 5.04% Open
02 Granite Speech 4.1 2B 5.33% Open
03 Cohere Transcribe 5.42% Open
04 Pulse Pro 5.42% API
05 Canary-Qwen-2.5B 5.63% Open
06 ElevenLabs Scribe v2 5.83% API
07 Parakeet TDT 0.6B v2 6.05% Open
08 Whisper Large v3 7.44% Open

Speaker

VoxCeleb1-O equal error rate. Lower is better.

# Model EER Kind
01 ReDimNet2-B6 0.29% Open
02 Wespeaker ResNet293 0.45% Open
03 ERes2Net-Large 0.57% Open
04 ERes2NetV2 0.61% Open
05 CAM++ 0.73% Open
06 ECAPA-TDNN 0.73% Open

Diarization

pyannote 3.1 DER, full protocol. Lower is better.

System Set DER Kind
pyannote 3.1 AISHELL-4 12.2% Open
pyannote 3.1 AMI headset 18.8% Open
pyannote 3.1 AMI distant 22.4% Open

Sources: Speech Arena, Open ASR, published VoxCeleb and pyannote evals.