Apples nya tal-API vs Whisper: det första riktiga benchmarket

Apple lanserade SpeechAnalyzer utan några siffror för träffsäkerheten. Vi mätte den mot API:t den ersätter och mot Whisper, på 5 559 standardiserade testyttranden – och släppte varje transkript.

Benchmark: Apples nya tal-API vs Whisper

Uppdatering 2026-07-15: Runda 2 är publicerad och lägger till NVIDIA Parakeet TDT v2/v3 (jämförelsen flest läsare bad om) och MOSS-Transcribe-Diarize, mätta på exakt samma korpus och med samma poängsättning.

Resultatet, direkt

Apples nya SpeechAnalyzer är den mest träffsäkra taligenkänningsmotor på enheten som vi testade. Den slog varje Whisper-modell vi levererade vid den tiden, inklusive Whisper Small, på både den rena och den brusiga halvan av LibriSpeech – och körde ungefär tre gånger snabbare än Small. Och API:t den ersätter, SFSpeechRecognizer, kom sist på rent tal: bakom till och med Whisper Tiny, en modell på 40MB.

MotorWER test-cleanWER test-otherModellstorlek
Apple SpeechAnalyzer (iOS/macOS 26)2.12%4.56%system
Whisper Small (WhisperKit CoreML)3.74%7.95%~460MB
Whisper Base5.42%12.51%~140MB
Whisper Tiny7.88%17.04%~40MB
Apple SFSpeechRecognizer (äldre)9.02%16.25%system

Lägre är bättre: WER står för word error rate, andelen ord som en motor byter ut, tappar eller hittar på. LibriSpeech test-clean är 2 620 yttranden ren, uppläst engelska; test-other är 2 939 svårare, brusigare yttranden. Varje motor kördes helt på enheten, på en Apple M2 Pro (32GB, macOS 26.5.1).

Apple SpeechAnalyzer2.12%
Whisper Small3.74%
Whisper Base5.42%
Whisper Tiny7.88%
SFSpeechRecognizer (äldre)9.02%

Därför gjorde vi mätningen

Med iOS 26 och macOS 26 ersatte Apple SFSpeechRecognizer med ett nytt API: SpeechAnalyzer och SpeechTranscriber. Inga siffror för träffsäkerheten publicerades för något av dem. Så varje utvecklare som funderar på att migrera, och alla som jämför Apples inbyggda taligenkänning med Whisper, har fått gissa.

Vid tiden för det här benchmarket levererade vi båda Apple-motorerna och tre Whisper-modeller sida vid sida i Lyonesse, en privat AI-arbetsyta där transkribering och analys körs på enheten. Det gav oss ett ovanligt utgångsläge: vi kunde köra alla fem genom identiska produktionskodvägar, på samma maskin och samma ljud. Så det gjorde vi.

Bör du migrera bort från SFSpeechRecognizer?

Ja. Det är det tydligaste resultatet i datan. Det nya API:t sänker ordfelsfrekvensen med 3.5 till 4x på samma ljud: från 9.02% till 2.12% på rent tal, och från 16.25% till 4.56% på brusigt tal. Det finns ingen avvägning i träffsäkerhet att fundera över; det nya API:t vinner överallt där vi mätte, och det levererar text med skiljetecken och versaler där den äldre motorns utdata är råare.

Uttryckt annorlunda: ett timslångt möte som transkriberas med det äldre API:t innehåller ungefär fyra gånger så många felaktiga ord som samma möte genom SpeechAnalyzer. För mötesanteckningar du faktiskt ska lita på gör det verklig skillnad – använder din app fortfarande SFSpeechRecognizer för något längre än ett röstkommando är migreringen värd det på träffsäkerheten ensam.

SpeechAnalyzer vs Whisper

Det mer överraskande resultatet: Apples nya motor slog också Whisper Small, den största modellen vi levererade, med bekväm marginal på båda delarna – på ungefär en tredjedel av Whisper Smalls beräkningstid per sekund ljud. För engelska, på Apple-hårdvara, är den inbyggda motorn nu det starkaste alternativ på enheten vi kan mäta.

Whisper behåller två verkliga fördelar. Den täcker betydligt fler språk (SpeechTranscriber stöder runt 30 språkvarianter), och den kör överallt, inte bara på Apple-plattformar med OS 26. Men för engelsk transkribering på en modern iPhone eller Mac är tiden då Whisper var det självklara valet för träffsäkerhet förbi.

Vi ändrade vår egen produkt utifrån det här resultatet: Lyonesses Auto-motor föredrar nu SpeechAnalyzer för de språk den stöder. (Det gick längre efter runda 2: från och med Lyonesse 1.8.9 är Whisper-modellerna helt pensionerade, ersatta av NVIDIA Parakeet som reservmotor.) Att publicera ett benchmark och ignorera det i de egna standardinställningarna vore en märklig sorts ärlighet.

Hastighet

Alla fem motorerna körde bekvämt snabbare än realtid: mellan ungefär 12x och 40x på M2 Pro, vilket betyder att en timme ljud transkriberas på cirka 1.5 till 5 minuter på enheten. SpeechAnalyzer var ungefär 3x snabbare än Whisper Small per sekund ljud, samtidigt som den slog den på träffsäkerhet. Vi avstår medvetet från att publicera en exakt tidtabell per motor ännu: träffsäkerhetskörningarna delade maskin med en utvecklingsarbetslast, vilket inte påverkar WER men däremot lägger brus i tidsmätningen. Vi uppdaterar den här sidan med tider från en dedikerad körning på en oanvänd maskin.

Metod – och varför du kan kontrollera den

Ett benchmark från ett företag som säljer en av motorerna bör mötas med misstänksamhet. Vårt har två egenskaper byggda just för den misstänksamheten.

Whisper-kolumnen går att reproducera mot OpenAI:s egna siffror

Vi valde LibriSpeech just för att OpenAI har publicerat Whispers WER på den. Om vår testrigg mätte Whisper korrekt bör våra siffror landa på deras. Det gör de, på alla sex mätningarna:

Motor / delVåraOpenAI publiceratDelta
Whisper Tiny, test-clean7.88%7.6%+0.28
Whisper Base, test-clean5.42%5.0%+0.42
Whisper Small, test-clean3.74%3.4%+0.34
Whisper Tiny, test-other17.04%16.9%+0.14
Whisper Base, test-other12.51%12.4%+0.11
Whisper Small, test-other7.95%7.6%+0.35

Den lilla, konsekventa positiva avvikelsen (en något striktare textnormaliserare plus CoreML-kvantisering) är precis så en ärlig reproduktion ser ut; slumpmässiga fel hade spridit sig åt båda hållen. Eftersom samma korpus, normaliserare och poängräknare producerade Apple-kolumnerna ärver de siffror som ingen annan kan kontrollera sin validering från de siffror som vem som helst kan.

Råtranskripten är offentliga

Varje hypotes per yttrande för båda Apple-motorerna går att ladda ner nedan, bredvid referenstexten och WER per yttrande. Håller du inte med om vår normalisering? Räkna om själv.

Detaljerna som avgör om ett WER-tal betyder någonting

  • Samma produktionskodvägar. Varje motor kördes genom exakt den kod Lyonesse-användare får, inte en labbrigg med annan buffring eller andra inställningar.
  • Textnormalisering. LibriSpeech-referenserna är i versaler, utan skiljetecken och med siffror utskrivna i bokstäver; moderna motorer skriver ut skiljetecken och siffror. Båda sidor passerar samma normaliserare (versaler, skiljetecken, siffror till ord, sammandragningar), som speglar OpenAI:s engelska normaliserare. Poängsätter man rå text straffar man motorer för snygg formatering i stället för för felhörningar.
  • Korpus-WER, inte genomsnittlig WER. Totala fel delat med totalt antal referensord, så korta yttranden inte överviktas.
  • Helt på enheten, verifierat. SFSpeechRecognizer skickar som standard ljud till Apples servrar. Vi tvingade fram igenkänning på enheten och lät testriggen vägra köra i stället för att tyst falla tillbaka på molnet – dels för att ett molnresultat hade ogiltigförklarat jämförelsen, dels för att vi inte tänkte ladda upp 5 559 yttranden från en produkt byggd på privat AI.
  • Fel räknas, inte döljs. En motor som returnerar ingenting får 100% WER för det yttrandet. Det hände en gång på 27 795 transkriberingar (äldre API:t, test-other).

Vad bygget lärde oss om vår egen app

Benchmarket hittade en levererad bugg i Lyonesse. Vår filimport med Apple-motorn matade ljud till SpeechAnalyzer och stängde ingångsströmmen, men anropade aldrig finalizeAndFinishThroughEndOfInput(). Utan det anropet levererar analysatorn aldrig sina slutliga resultat, och importen hänger sig för evigt. Det hade gått obemärkt förbi eftersom vår Auto-inställning föredrog Whisper. Fixen levererades samma dag, och det är en del av varför vi publicerar detaljerna om testriggen: att noggrant mäta sin egen produkt har en tendens att hitta det man inte letade efter.

Begränsningar

  • Endast engelska. LibriSpeech är uppläst engelska. De här siffrorna säger ingenting om de 100+ språk som Whisper stöder men SpeechTranscriber inte gör.
  • Uppläst ljudbokstal, inte möten. LibriSpeech är den standardiserade, jämförbara korpusen, och därför började vi där. Ljud med brytning, avstånd till mikrofonen och flera talare är den självklara uppföljningen.
  • En maskin. M2 Pro, macOS 26.5.1. Träffsäkerheten bör föras över mellan Apple Silicon-chip; hastigheten varierar per chip.
  • Whisper via WhisperKit CoreML. Kvantiserade konverteringar för körning på enheten, samma byggen som Lyonesse levererade vid den tiden (sedan 1.8.9 levererar appen NVIDIA Parakeet i stället). Referensimplementationer på GPU kan avvika något, vilket valideringstabellen kvantifierar.

Vad det här betyder om du bara vill ha bra transkribering

Har du en modern iPhone eller Mac finns den bästa motorn för engelsk transkribering på enheten redan i operativsystemet – och det privata alternativet är inte längre kompromissen. Lyonesse bygger på motorerna som mättes här: SpeechAnalyzer där den stöder ditt språk, och sedan version 1.8.9 NVIDIA Parakeet som reserv i stället för Whisper – transkriberingen körs helt på enheten, och inget ljud laddas upp för bearbetning. Benchmarket är inte något vid sidan av produkten; det är så vi bestämmer vad produkten gör.

Vidare läsning