Apple'ın Yeni Speech API'si vs Whisper: İlk Gerçek Kıyaslama

Apple, SpeechAnalyzer'ı hiçbir doğruluk rakamı vermeden yayımladı. Biz onu yerini aldığı API'ye ve Whisper'a karşı, 5.559 standart test konuşmasında ölçtük ve her transkripsiyonu yayımladık.

Apple'ın Yeni Speech API'si vs Whisper kıyaslaması

Güncelleme 2026-07-15: 2. tur yayında; en çok okuyucunun istediği karşılaştırma olan NVIDIA Parakeet TDT v2/v3 ile MOSS-Transcribe-Diarize'ı, aynı korpus ve puanlama üzerinde ölçerek ekliyor.

Sonuç, en baştan

Apple'ın yeni SpeechAnalyzer'ı, test ettiğimiz en doğru cihaz üzerinde konuşma motoru. O dönemde birlikte sunduğumuz her Whisper modelini —Whisper Small dâhil— LibriSpeech'in hem temiz hem gürültülü yarısında geçti; üstelik Small'dan kabaca üç kat daha hızlı çalışarak. Ve yerini aldığı API olan SFSpeechRecognizer temiz konuşmada sonuncu geldi: 40MB'lık bir model olan Whisper Tiny'nin bile gerisinde.

Motortest-clean WERtest-other WERModel boyutu
Apple SpeechAnalyzer (iOS/macOS 26)%2,12%4,56sistem
Whisper Small (WhisperKit CoreML)%3,74%7,95~460MB
Whisper Base%5,42%12,51~140MB
Whisper Tiny%7,88%17,04~40MB
Apple SFSpeechRecognizer (eski)%9,02%16,25sistem

Düşük olan daha iyidir: WER, kelime hata oranıdır; yani bir motorun değiştirdiği, düşürdüğü ya da uydurduğu kelimelerin yüzdesi. LibriSpeech test-clean, 2.620 konuşmalık temiz, okunmuş konuşmadır; test-other ise 2.939 daha zor, daha gürültülü konuşmadır. Her motor, bir Apple M2 Pro (32GB, macOS 26.5.1) üzerinde tamamen cihaz üzerinde çalıştı.

Apple SpeechAnalyzer%2,12
Whisper Small%3,74
Whisper Base%5,42
Whisper Tiny%7,88
SFSpeechRecognizer (eski)%9,02

Bunu neden yaptık

iOS 26 ve macOS 26 ile Apple, SFSpeechRecognizer'ı yeni bir API olan SpeechAnalyzer ve SpeechTranscriber ile değiştirdi. İkisi için de hiçbir doğruluk rakamı yayımlamadı. Dolayısıyla geçiş yapıp yapmamaya karar veren her geliştirici ve Apple'ın yerleşik tanımasını Whisper ile karşılaştıran herkes tahmin yürütüyordu.

Bu kıyaslamanın yapıldığı dönemde her iki Apple motorunu ve üç Whisper modelini yan yana, cihaz üzerinde gizli bir yapay zeka çalışma alanı olan Lyonesse'de sunuyorduk; bu da bizi alışılmadık bir konuma yerleştirdi: beşinin de aynı üretim kod yollarından, aynı makinede ve aynı sesle geçmesini sağlayabiliyorduk. Biz de öyle yaptık.

SFSpeechRecognizer'dan geçiş yapmalı mısınız?

Evet. Verideki en net sonuç bu. Yeni API, aynı seste kelime hata oranını 3,5 ila 4 kat düşürüyor: temiz konuşmada %9,02'den %2,12'ye, gürültülü konuşmada %16,25'ten %4,56'ya. Tartılacak bir doğruluk ödünü yok; yeni API ölçtüğümüz her yerde kazanıyor ve eski motorun çıktısı daha kabayken o, noktalama ve büyük/küçük harfli metin üretiyor.

Başka bir deyişle: eski API ile transkribe edilen bir saatlik toplantıda, aynı toplantının SpeechAnalyzer'dan geçmiş hâline göre kabaca dört kat daha fazla yanlış kelime bulunur. Uygulamanız hâlâ bir sesli komuttan daha uzun herhangi bir şey için SFSpeechRecognizer kullanıyorsa, geçiş tek başına doğruluk açısından bile değer.

SpeechAnalyzer vs Whisper

Daha şaşırtıcı sonuç: Apple'ın yeni motoru, sunduğumuz en büyük model olan Whisper Small'u da her iki bölümde rahat bir farkla, üstelik Whisper Small'un ses saniyesi başına harcadığı hesaplama süresinin yaklaşık üçte biriyle geçti. İngilizce için, Apple donanımında, yerleşik motor artık ölçebildiğimiz en güçlü cihaz üzerinde seçenek.

Whisper'ın iki gerçek avantajı sürüyor. Çok daha fazla dili kapsıyor (SpeechTranscriber yaklaşık 30 yerel ayarı destekliyor) ve yalnızca OS 26'lı Apple platformlarında değil, her yerde çalışıyor. Ama güncel bir iPhone veya Mac'te İngilizce transkripsiyon için Whisper'ın otomatik doğruluk tercihi olduğu günler geride kaldı.

Bu sonuç üzerine kendi ürünümüzü değiştirdik: Lyonesse'in Auto motoru artık desteklediği diller için SpeechAnalyzer'ı tercih ediyor. (2. turdan sonra daha da ileri gitti: Lyonesse 1.8.9 itibarıyla Whisper modelleri tamamen emekliye ayrıldı, yerine yedek motor olarak NVIDIA Parakeet geçti.) Bir kıyaslama yayımlayıp kendi varsayılanlarında onu görmezden gelmek, tuhaf bir dürüstlük olurdu.

Hız

Beş motorun tamamı gerçek zamandan rahatça daha hızlı çalıştı: M2 Pro'da kabaca 12x ile 40x arasında, yani bir saatlik ses cihaz üzerinde yaklaşık 1,5 ila 5 dakikada transkribe oluyor. SpeechAnalyzer, ses saniyesi başına Whisper Small'dan yaklaşık 3 kat daha hızlıyken doğrulukta da onu geçti. Motor başına kesin bir zamanlama tablosunu bilerek henüz yayımlamıyoruz: doğruluk çalışmaları makineyi bir geliştirme iş yüküyle paylaştı; bu WER'i etkilemez ama zamanlamaya gürültü ekler. Bu sayfayı özel bir boşta çalıştırmadan alınan zamanlamalarla güncelleyeceğiz.

Yöntem ve neden doğrulayabileceğiniz

Motorlardan birini satan bir şirketin yaptığı kıyaslamaya kuşkuyla yaklaşılmalı. Bizimkinin, tam da bu kuşku için tasarlanmış iki özelliği var.

Whisper sütunu, OpenAI'ın kendi rakamlarına karşı yeniden üretilebilir

LibriSpeech'i tam olarak OpenAI'ın Whisper'ın WER'ini onun üzerinde yayımladığı için kullandık. Test düzeneğimiz Whisper'ı doğru ölçtüyse, bizim rakamlarımız onlarınkine oturmalı. Altı ölçümün tamamında öyle oluyor:

Motor / bölümBizimOpenAI yayımlananFark
Whisper Tiny, test-clean%7,88%7,6+0,28
Whisper Base, test-clean%5,42%5,0+0,42
Whisper Small, test-clean%3,74%3,4+0,34
Whisper Tiny, test-other%17,04%16,9+0,14
Whisper Base, test-other%12,51%12,4+0,11
Whisper Small, test-other%7,95%7,6+0,35

Bu küçük, tutarlı pozitif sapma (biraz daha katı bir metin normalleştirici artı CoreML nicemleme) dürüst bir yeniden üretimin nasıl göründüğüdür; rastgele hata iki yöne de saçılırdı. Apple sütunlarını da aynı korpus, normalleştirici ve puanlayıcı ürettiği için, başka kimsenin doğrulayamayacağı rakamlar, herkesin doğrulayabileceği rakamlardan gelen doğrulamayı miras alıyor.

Ham transkripsiyonlar herkese açık

Her iki Apple motoru için konuşma başına her hipotez, referans metin ve konuşma başına WER ile birlikte aşağıda indirilebilir. Normalleştirmemize katılmıyor musunuz? Kendiniz yeniden puanlayın.

Bir WER rakamının bir anlam taşıyıp taşımadığını belirleyen ayrıntılar

  • Aynı üretim kod yolları. Her motor, farklı ara belleğe alma veya ayarlarla bir laboratuvar düzeneğinden değil, Lyonesse kullanıcılarının aldığı tam koddan geçti.
  • Metin normalleştirme. LibriSpeech referansları büyük harfli, noktalamasız ve sayılar yazıyla; modern motorlar ise noktalama ve rakam üretiyor. İki taraf da aynı normalleştiriciden geçiyor (büyük/küçük harf, noktalama, rakamdan-yazıya, kısaltmalar), OpenAI'ın İngilizce normalleştiricisini yansıtarak. Ham metni puanlarsanız, motorları yanlış duydukları için değil, güzel biçimlendirdikleri için cezalandırırsınız.
  • Ortalama WER değil, korpus WER'i. Toplam hatalar toplam referans kelimelere bölünür, böylece kısa konuşmalar aşırı ağırlıklandırılmaz.
  • Tamamen cihaz üzerinde, doğrulanmış. SFSpeechRecognizer sesi varsayılan olarak Apple'ın sunucularına gönderir. Cihaz üzerinde tanımayı zorunlu kıldık ve test düzeneğinin sessizce buluta düşmek yerine çalışmayı reddetmesini sağladık; hem bir bulut sonucu karşılaştırmayı geçersiz kılacağı için hem de gizliliğe önem veren bir üründen 5.559 konuşmayı yükleyecek değildik.
  • Başarısızlıklar gizlenmedi, sayıldı. Hiçbir şey döndürmeyen bir motor o konuşma için %100 WER alır. 27.795 transkripsiyonda bir kez oldu (eski, test-other).

Bunu inşa etmenin kendi uygulamamız hakkında bize öğrettikleri

Kıyaslama, Lyonesse'te canlıda olan bir hata buldu. Apple motorlu dosya içe aktarmamız sesi SpeechAnalyzer'a besliyor ve giriş akışını kapatıyordu, ama finalizeAndFinishThroughEndOfInput()'ı asla çağırmıyordu. Bu çağrı olmadan çözümleyici nihai sonuçlarını hiç teslim etmiyor ve içe aktarma sonsuza dek takılıyor. Auto ayarımız Whisper'ı tercih ettiği için fark edilmemişti. Düzeltme aynı gün yayımlandı ve test düzeneği ayrıntılarını yayımlamamızın bir nedeni de bu: kendi ürününüzü dikkatle ölçmenin, aramadığınız şeyleri bulma gibi bir huyu var.

Sınırlamalar

  • Yalnızca İngilizce. LibriSpeech İngilizce okunmuş konuşmadır. Bu rakamlar, Whisper'ın desteklediği ama SpeechTranscriber'ın desteklemediği 100'den fazla dil hakkında hiçbir şey söylemez.
  • Toplantı değil, okunmuş sesli kitap konuşması. LibriSpeech standart, karşılaştırılabilir korpustur; bu yüzden onunla başladık. Aksanlı, uzak alanlı ve çok konuşmacılı toplantı sesi bariz bir sonraki adım.
  • Tek makine. M2 Pro, macOS 26.5.1. Doğruluk Apple Silicon genelinde aktarılmalı; hız çipe göre değişecektir.
  • WhisperKit CoreML aracılığıyla Whisper. Nicemlenmiş cihaz üzerinde dönüşümler, Lyonesse'in o dönemde sunduğu aynı derlemeler (1.8.9'dan beri uygulama bunun yerine NVIDIA Parakeet sunuyor). Referans GPU uygulamaları biraz farklılık gösterebilir; doğrulama tablosu bunu sayısallaştırıyor.

Sadece iyi bir transkripsiyon isteyen biri için bunun anlamı

Güncel bir iPhone veya Mac kullanıyorsanız, İngilizce için en iyi cihaz üzerinde transkripsiyon motoru zaten işletim sisteminizde ve gizli seçenek artık ödün verme seçeneği değil. Lyonesse tam olarak burada ölçülen motorları kullanıyor: dilinizi desteklediği yerde SpeechAnalyzer, desteklemediği yerde Whisper; hepsi tamamen cihaz üzerinde, hiçbir şey yüklenmeden. Kıyaslama üründen ayrı değil; ürünün ne yapacağına böyle karar veriyoruz.

İlgili okumalar