First quantitative evaluation of Somali ASR. Mean WER: 0.368 (ours) vs 0.592 (ElevenLabs) vs 0.871 (Whisper). Broadcast validation in August 2026 (SASR Eval broadcast validation).
| Document | Description | Format |
|---|---|---|
| SASR Eval | Full evaluation paper, methodology, results, and analysis | |
| SASR Eval results | Per-clip WER/CER, hypotheses, references, and summary statistics | JSON |
| SASR Eval per-clip data | Clip-by-clip scores and transcript text | CSV |
| SASR Eval findings | Detailed benchmark analysis and notable clip examples | Markdown |
| SASR Eval pilot results | Prior reference-free evaluation (June 2026) | JSON |
| SASR Eval pilot per-clip data | Reference-free pass clip data | CSV |
Evaluated June 22, 2026 on 50 stitched clips (~10 seconds each, ~550 seconds total) from the skydheere/soomali-asr-dataset test split. Ground-truth transcriptions used for WER and CER scoring.
| System | n | Mean WER | Mean CER | Parameters |
|---|---|---|---|---|
| Fine-tuned Whisper small (ours) Trained ~1 hr on T4 GPU, 500 steps | 50 | 0.368 | - | 244M |
| ElevenLabs Scribe v1 Commercial ASR API | 50 | 0.592 | 0.185 | - |
| faster-whisper large-v3 Open-source baseline | 50 | 0.871 | 0.266 | 1.5B |
Our fine-tuned Whisper small achieves mean WER 0.368 versus ElevenLabs Scribe v1 at 0.592. Domain-specific training on Somali closes a gap that commercial systems leave open.
Despite using a model 6× smaller (244M vs 1.5B parameters), our fine-tuned system outperforms the large-v3 baseline by a wide margin on this evaluation set.
On public dataset clips, ElevenLabs wins 44 of 50 by WER. Our fine-tuned model is designed for in-domain broadcast data, SASR Eval broadcast validation (August 2026) will validate on regional archives.
Single T4 GPU, 500 training steps. Demonstrates that low-resource language ASR improvement does not require massive compute and is relevant for rapid deployment in operational environments.
Selected clips illustrating system behavior across the evaluation set. Full per-clip data in SASR Eval.
Per-clip WER comparison between the two baseline commercial/open-source systems evaluated in SASR Eval. ElevenLabs wins 44 of 50 clips. 2 ties. Whisper wins 4.
| Clip | Whisper WER | ElevenLabs WER | Winner |
|---|---|---|---|
| clip01 | 0.938 | 0.438 | ElevenLabs |
| clip02 | 0.684 | 0.526 | ElevenLabs |
| clip03 | 0.812 | 0.688 | ElevenLabs |
| clip04 | 0.722 | 0.556 | ElevenLabs |
| clip05 | 0.957 | 0.696 | ElevenLabs |
| clip06 | 0.850 | 0.650 | ElevenLabs |
| clip07 | 0.850 | 0.650 | ElevenLabs |
| clip08 | 0.727 | 0.818 | Whisper |
| clip09 | 0.882 | 0.588 | ElevenLabs |
| clip10 | 0.905 | 0.857 | ElevenLabs |
| clip11 | 0.867 | 1.000 | Whisper |
| clip12 | 0.923 | 0.846 | ElevenLabs |
| clip13 | 0.857 | 0.762 | ElevenLabs |
| clip14 | 0.667 | 0.917 | Whisper |
| clip15 | 0.900 | 0.500 | ElevenLabs |
| clip16 | 0.824 | 0.529 | ElevenLabs |
| clip17 | 0.824 | 0.647 | ElevenLabs |
| clip18 | 0.667 | 0.500 | ElevenLabs |
| clip19 | 1.231 | 0.462 | ElevenLabs |
| clip20 | 0.917 | 0.500 | ElevenLabs |
| clip21 | 0.809 | 0.714 | ElevenLabs |
| clip22 | 0.842 | 0.737 | ElevenLabs |
| clip23 | 0.765 | 0.882 | Whisper |
| clip24 | 0.944 | 0.667 | ElevenLabs |
| clip25 | 1.000 | 0.625 | ElevenLabs |
| clip26 | 0.765 | 0.412 | ElevenLabs |
| clip27 | 0.950 | 0.700 | ElevenLabs |
| clip28 | 1.438 | 0.875 | ElevenLabs |
| clip29 | 0.818 | 0.682 | ElevenLabs |
| clip30 | 0.867 | 0.400 | ElevenLabs |
| clip31 | 0.733 | 0.333 | ElevenLabs |
| clip32 | 0.889 | 0.556 | ElevenLabs |
| clip33 | 0.950 | 0.400 | ElevenLabs |
| clip34 | 0.938 | 0.562 | ElevenLabs |
| clip35 | 0.769 | 0.308 | ElevenLabs |
| clip36 | 0.842 | 0.263 | ElevenLabs |
| clip37 | 0.778 | 0.333 | ElevenLabs |
| clip38 | 1.000 | 0.818 | ElevenLabs |
| clip39 | 0.941 | 0.529 | ElevenLabs |
| clip40 | 0.682 | 0.682 | Tie |
| clip41 | 0.800 | 0.267 | ElevenLabs |
| clip42 | 0.833 | 0.417 | ElevenLabs |
| clip43 | 1.059 | 0.529 | ElevenLabs |
| clip44 | 1.000 | 0.571 | ElevenLabs |
| clip45 | 0.923 | 0.538 | ElevenLabs |
| clip46 | 1.000 | 0.667 | ElevenLabs |
| clip47 | 0.933 | 0.600 | ElevenLabs |
| clip48 | 0.789 | 0.789 | Tie |
| clip49 | 0.619 | 0.476 | ElevenLabs |
| clip50 | 0.875 | 0.125 | ElevenLabs |
SASR Eval validated our fine-tuned model on public Somali speech data. SASR Eval broadcast validation will evaluate performance on in-domain broadcast recordings from regional archives. The data our platform is designed to process at scale.
50 clips from skydheere/soomali-asr-dataset. Three systems evaluated. Fine-tuned Whisper small: WER 0.368.
Broadcast data validation from regional archives. Tests in-domain generalization and operational readiness.