SASR Eval paper available. Methodology, per-clip data, and methodological notes.

Download SASR Eval
Document Description Format
SASR Eval Full evaluation paper, methodology, results, and analysis PDF
SASR Eval results Per-clip WER/CER, hypotheses, references, and summary statistics JSON
SASR Eval per-clip data Clip-by-clip scores and transcript text CSV
SASR Eval findings Detailed benchmark analysis and notable clip examples Markdown
SASR Eval pilot results Prior reference-free evaluation (June 2026) JSON
SASR Eval pilot per-clip data Reference-free pass clip data CSV

Aggregate results.

Evaluated June 22, 2026 on 50 stitched clips (~10 seconds each, ~550 seconds total) from the skydheere/soomali-asr-dataset test split. Ground-truth transcriptions used for WER and CER scoring.

System n Mean WER Mean CER Parameters
Fine-tuned Whisper small (ours) Trained ~1 hr on T4 GPU, 500 steps 50 0.368 - 244M
ElevenLabs Scribe v1 Commercial ASR API 50 0.592 0.185 -
faster-whisper large-v3 Open-source baseline 50 0.871 0.266 1.5B
37.8%
Relative WER reduction
vs. ElevenLabs
57.8%
Relative WER reduction
vs. Whisper large-v3
44 / 50
Clips ElevenLabs wins
by WER (baseline systems)
81.5%
ElevenLabs char accuracy
Mean CER 0.185

What the numbers show.

37.8%

Relative reduction vs. ElevenLabs

Our fine-tuned Whisper small achieves mean WER 0.368 versus ElevenLabs Scribe v1 at 0.592. Domain-specific training on Somali closes a gap that commercial systems leave open.

57.8%

Relative reduction vs. Whisper large-v3

Despite using a model 6× smaller (244M vs 1.5B parameters), our fine-tuned system outperforms the large-v3 baseline by a wide margin on this evaluation set.

In-domain

Performance on broadcast data

On public dataset clips, ElevenLabs wins 44 of 50 by WER. Our fine-tuned model is designed for in-domain broadcast data, SASR Eval broadcast validation (August 2026) will validate on regional archives.

~1 hour

Training efficiency

Single T4 GPU, 500 training steps. Demonstrates that low-resource language ASR improvement does not require massive compute and is relevant for rapid deployment in operational environments.

Per-clip examples.

Selected clips illustrating system behavior across the evaluation set. Full per-clip data in SASR Eval.

clip50: Best ElevenLabs performance

ElevenLabs WER: 0.125 Whisper WER: 0.875
Reference maalaa Guriga dadka soo dhisay ma aragtay? Waxaa yimid arday badan. Waxaa aan jeclaa Emma. gurigaygan
ElevenLabs Maalaa guriga dadka soo dhisay ma aragtay. Waxaay yimid arday badan waxa aan jeclaa emma gurigaygan.
Whisper maa laa guriga dadka saadisay maa raqday waha yimid ardaybadan waha ancha laa emma guriga igan
ElevenLabs near-perfectly transcribes a full sentence. Whisper mangles several words (“saadisay” for “soo dhisay”, “raqday” for “aragtay”).

clip36: Proper noun preservation

ElevenLabs WER: 0.263 Whisper WER: 0.842
Reference Hargeysa waa magaalo weyn. Kani waa kaanaga. Warsame! farasey! Waan aqaannaa ardayda oo idil. maxkamadda gobolka qorayaasha iyo boqorrada
ElevenLabs Hargeysa waa magaalo weyn. Kani waa kaannada. Warsame. Farasay. Waan aqaana ardayda oo idil. Maxkamadda gobolka. Qorshaha iyo boqorada.
Whisper Har geysa waa magaalaa weyn. Kani waa kaan naga. Huwar samay. Farasay. Waan aqaanaa radaayda oo eedil. Mahkamadda goblka. Urayaasha iyo baxar rada.
ElevenLabs preserves proper nouns (“Hargeysa”, “Warsame”, “Maxkamadda”) and sentence structure. Whisper splits tokens and garbles proper nouns.

clip11: Worst ElevenLabs performance

ElevenLabs WER: 1.000 Whisper WER: 0.867
Reference goror caanaha saca raggaa Saddexda wiil ayaad ammaantay. OSV Dhiso. maalmo afar ah oo horreysay
ElevenLabs Wuxuu u geystay qorayn ayaa ah goorar. Canaan saac. Ragga. Saddex daweyl ayaa dambe. Dhiso. Maalmo afar ah oo horaysay.
Whisper qorar aanaha saad ragga sada dhawiyil aya dhammaante diso maalmo qafar ah oo horay say
Annotation artifact (“OSV”) in the ground truth reference threw off ElevenLabs. Whisper echoed more of the phonetic surface form.

clip28: Largest performance gap

Whisper WER: 1.438 ElevenLabs WER: 0.875
Reference qalimmada silsiladahayga dukaanle Ninkii libaaxii qabtay miyuu la hadlay? S/SOVAV baaldiyo labo ganacsato oo waawanaagsan
ElevenLabs Xalammada silsiladaha iga dukaan leh ninkii libaaxi qabtay miyu la hadlay baal diyo laba ganacsi ugu wanaagsan.
Whisper Qalima dha. Silsila dhaha yiga. Du kaan la. Ninkin li baax hii qabtay. Miuu lahad la. Baal diyo. La baga naa sato'u buwan-buwan ahaksan.
Whisper fragments continuous speech into spurious sentence breaks, inflating WER past 1.0. ElevenLabs handles run-on sentence structure better.

ElevenLabs vs. Whisper large-v3 (baseline systems).

Per-clip WER comparison between the two baseline commercial/open-source systems evaluated in SASR Eval. ElevenLabs wins 44 of 50 clips. 2 ties. Whisper wins 4.

Clip Whisper WER ElevenLabs WER Winner
clip010.9380.438ElevenLabs
clip020.6840.526ElevenLabs
clip030.8120.688ElevenLabs
clip040.7220.556ElevenLabs
clip050.9570.696ElevenLabs
clip060.8500.650ElevenLabs
clip070.8500.650ElevenLabs
clip080.7270.818Whisper
clip090.8820.588ElevenLabs
clip100.9050.857ElevenLabs
clip110.8671.000Whisper
clip120.9230.846ElevenLabs
clip130.8570.762ElevenLabs
clip140.6670.917Whisper
clip150.9000.500ElevenLabs
clip160.8240.529ElevenLabs
clip170.8240.647ElevenLabs
clip180.6670.500ElevenLabs
clip191.2310.462ElevenLabs
clip200.9170.500ElevenLabs
clip210.8090.714ElevenLabs
clip220.8420.737ElevenLabs
clip230.7650.882Whisper
clip240.9440.667ElevenLabs
clip251.0000.625ElevenLabs
clip260.7650.412ElevenLabs
clip270.9500.700ElevenLabs
clip281.4380.875ElevenLabs
clip290.8180.682ElevenLabs
clip300.8670.400ElevenLabs
clip310.7330.333ElevenLabs
clip320.8890.556ElevenLabs
clip330.9500.400ElevenLabs
clip340.9380.562ElevenLabs
clip350.7690.308ElevenLabs
clip360.8420.263ElevenLabs
clip370.7780.333ElevenLabs
clip381.0000.818ElevenLabs
clip390.9410.529ElevenLabs
clip400.6820.682Tie
clip410.8000.267ElevenLabs
clip420.8330.417ElevenLabs
clip431.0590.529ElevenLabs
clip441.0000.571ElevenLabs
clip450.9230.538ElevenLabs
clip461.0000.667ElevenLabs
clip470.9330.600ElevenLabs
clip480.7890.789Tie
clip490.6190.476ElevenLabs
clip500.8750.125ElevenLabs

SASR Eval broadcast validation (August 2026)

SASR Eval validated our fine-tuned model on public Somali speech data. SASR Eval broadcast validation will evaluate performance on in-domain broadcast recordings from regional archives. The data our platform is designed to process at scale.

June 22, 2026 (Complete)

SASR Eval

50 clips from skydheere/soomali-asr-dataset. Three systems evaluated. Fine-tuned Whisper small: WER 0.368.

August 2026

SASR Eval broadcast validation

Broadcast data validation from regional archives. Tests in-domain generalization and operational readiness.