Bu hamle, Microsoft'un iki yıl önce akla gelmeyecek bir stratejiyi adım adım hayata geçirdiğini gösteriyor: Her modalite için kendi sınır modellerini geliştirmek ve bir zamanlar OpenAI teknolojisiyle çalışan ürünlere bu modelleri yerleştirmek. Transkripsiyon, bu planın en hızlı ilerlediği alan olurken MAI-Transcribe-2 de en net kanıtı olarak öne çıkıyor. Model aynı zamanda dünyanın en değerli yazılım şirketinin, 13 milyar dolar yatırım yaptığı ortağına bağımlı kalmadan yapay zekada nasıl rekabet etmeyi planladığına dair bir ön izleme sunuyor.
MAI-Transcribe-2 Neler Sunuyor ve Kurumsal Alıcılar İçin Neden Önemli
Model 60 dilde transkripsiyon yapıyor. Bu sayı Haziran ayında çıkan MAI-Transcribe-1.5'te 43, Nisan ayındaki ilk sürüm MAI-Transcribe-1'de ise 25 idi. MAI-Transcribe-2, geliştiricilere yönelik model pazaryeri Microsoft Foundry ve test ortamı MAI Playground üzerinden çalışıyor. Microsoft, modeli temiz stüdyo kayıtları yerine işletmelerin ürettiği dağınık sesler için geliştirdiğini belirtiyor; arka plan gürültüsü, düşük kaliteli kayıtlar ve üst üste binen konuşmalar bu kapsama giriyor.Dil sayısından daha önemli olan, Microsoft'un temel ürüne dahil ettiği özellik paketi. Konuşmacı ayrımı, çok kişili bir kayıtta kimin ne söylediğini ayırarak metin yığınını kullanılabilir bir toplantı tutanağına dönüştürüyor. Kelime düzeyinde zaman damgaları her kelimeye hassas bir zaman işareti ekleyerek arama, düzenleme ve video ile hizalamayı mümkün kılıyor. Anahtar kelime yönlendirmesi, geliştiricilerin ilaç adları, ürün kodları veya çalışan isimlerinden oluşan bir listeyi modele vererek alan jargonundaki hataları azaltmasını sağlıyor. Otomatik dil tanımlama ise kullanıcının dili önceden belirtme zorunluluğunu ortadan kaldırıyor.
İki özellik özgüllüğüyle öne çıkıyor. Yapılandırılabilir çıktı stili, uyum ve hukuk ekipleri için her "şey", yanlış başlangıç ve kekelemeyi koruyan "kelimesi kelimesine" modu ile okunabilir altyazılar ve notlar için dolgu sözcüklerini temizleyen "sade" modu sunuyor. Kod değiştirme ise cümle içinde diller arası geçişi ele alıyor; Microsoft özellikle Hinglish ve Spanglish örneklerini veriyor. Bu, tek bir müşteri hizmetleri görüşmesinin bir düzine kez dil değiştirebildiği Hindistan ve ABD Hispanik pazarlarına doğrudan bir gönderme. Uzman tedarikçiler tarihsel olarak bu yeteneklerin her biri için ek ücret talep ederken Microsoft hepsini 10 centlik taban fiyata dahil ediyor.
FLEURS ve Artificial Analysis Karşılaştırmaları Nasıl Okunmalı
Microsoft üç performans iddiasında bulunuyor ve her biri farklı bir ölçüte dayanıyor. İlk iddia, MAI-Transcribe-2'nin 60 dilde FLEURS'ta ortalama yüzde 5,2 kelime hata oranı ile birinci sırada yer aldığı yönünde. FLEURS, Google araştırmacılarının 2022'de yayımladığı bir kıyas seti; 102 dilin her birinde anadili konuşan kişilerin yaklaşık 2 bin cümleyi okumasıyla oluşturuldu ve dil başına yaklaşık 12 saatlik konuşma içeriyor. Çok dilli konuşma tanıma için standart ölçüt kabul ediliyor çünkü bir modelin Svahili dilindeki başarısını İsveççe ile aynı içerik üzerinden karşılaştırmaya olanak tanıyor. Kelime hata oranı, insan referansına karşı yer değiştirme, ekleme ve silmeleri sayıyor; yüzde 5,2 yaklaşık olarak her 20 kelimeden birinin yanlış olduğu anlamına geliyor. Ancak FLEURS okunmuş konuşma üzerine kurulu, sohbet değil. Ayrıca Microsoft'un ortalaması Haziran'da MAI-Transcribe-1.5 için açıkladığı yüzde 3,7'den yükselmiş durumda. Bu neredeyse kesinlikle bir gerilemeden çok kapsam genişlemesini yansıtıyor; 43 yerine 60 dilde ortalama almak, her modelin zorlandığı düşük kaynaklı dilleri de hesaba katmak demek. Alıcıların dil bazında kırılımı talep etmesi gerekiyor.İkinci iddia, modelin Artificial Analysis kelime hata oranı liderlik tablosunda ikinci sırada yer aldığı ve bu firmanın doğruluk-gecikme Pareto sınırını belirlediği yönünde. Artificial Analysis, modelleri herkese açık API'leri üzerinden test eden bağımsız bir kıyaslayıcı ve müşterinin gerçekte ne aldığını ölçüyor. Endeksi, simüle edilmiş ajan konuşmaları, Avrupa Parlamentosu konuşmaları ve şirket bilanço görüşmelerinin bir karışımını içeriyor ve ağırlığı İngilizce iş konuşmalarına veriyor. Haziran'da firma MAI-Transcribe-1.5'i yüzde 2,4 kelime hata oranı ile üçüncü sıraya yerleştirmiş, Alibaba'nın Fun-Realtime-ASR-preview ve ElevenLabs'ın Scribe v2 modelinin gerisinde bırakırken ilk 10 içindeki en hızlı model olarak nitelemişti. İkinci sıraya yükselmek Microsoft'un ElevenLabs'ı geride bıraktığını düşündürüyor. "Pareto sınırı" ifadesi kritik; bu, hiçbir rakibin daha yavaş olmadan modelden daha doğru, daha doğru olmadan da daha hızlı olamadığı anlamına geliyor.
Üçüncü iddia ham hızla ilgili. Artificial Analysis değerlendirmelerine göre model, OpenAI'ın GPT-Transcribe'ından 10 kat, ElevenLabs'ın Scribe v2'sinden yedi kat ve Google'ın Gemini 3.5 Transcribe'ından beş kat daha hızlı. Toplu transkripsiyonda hız, bekleme süresinden çok verimlilik ve maliyet demek. Gerçek zamanın 300 katı hızla çalışan bir model, 30 kat hızla çalışana göre çok daha az GPU saatine ihtiyaç duyuyor. Bu verimlilik, Microsoft'un 10 cent talep ederken kâr edebilmesini sağlayan unsur olarak gösteriliyor.
Beş Ayda Üç Model: Hızlı Yayın Takviminin Perde Arkası
Takvim başlı başına bir hikaye anlatıyor. 2 Nisan'da MAI-Transcribe-1, 25 dil ve saatte 0,36 dolar fiyatla çıktı. 2 Haziran'da MAI-Transcribe-1.5, 43 dil, anahtar kelime yönlendirmesi ve Artificial Analysis'te üçüncülükle geldi. Bugün MAI-Transcribe-2, 60 dil, konuşmacı ayrımı, zaman damgaları, kod değiştirme, ikincilik ve 0,10 dolar fiyatla sevk edildi. Beş ayda üç sürüm, her biri dil kapsamını yaklaşık yüzde 40 genişletirken rakiplerin premium katmanlarda sunduğu özellikleri ekledi.Bu tempo, mimarisi oturmuş ve artık veri ile ölçek üzerinden düzenli iyileşme sağlayan bir ekibin çalışma biçimine işaret ediyor; konuşma modellerinin hızlı ve öngörülebilir biçimde geliştiği evre bu. Aynı zamanda transkripsiyonu başkası yapmadan önce metalaştırma niyetini de gösteriyor.
Bu hızın arkasındaki organizasyonel kurguyu Microsoft AI Üst Yöneticisi Mustafa Süleyman, Nisan ayında The Verge'e anlatmıştı. İlk modeli "bürokrasiden arındırılmış, küçük ve odaklanmış 10 kişilik bir ekip"e atfetmiş, çevresindeki daha geniş grubun ise tedarikçi yönetimi ve veri tedarikini üstlendiğini söylemişti. Süleyman ayrıca modelin "diğer son teknoloji modellerin GPU maliyetinin yarısıyla" çalıştığını ve bunun Microsoft için "büyük bir maliyet tasarrufu" olduğunu belirtmişti. The Verge, Meta, Amazon, Google ve Anthropic'in de benzer düzleştirilmiş yapıları denediğini aktarmıştı. Microsoft'un transkripsiyon serisi, bu yaklaşımın araştırma makalesinden çok ticari sonuç üretip üretmediğinin en görünür testi.
13 Milyar Dolarlık OpenAI Yatırımına Rağmen Öz Model Hamlesi
Microsoft, OpenAI'a 13 milyar dolardan fazla yatırım yaptı ve OpenAI modellerini Azure, Office ve Copilot genelinde barındırıyor. Son dört yıldır Microsoft'un kendi modelini geliştirmesinin nedeni sıkça sorgulandı. Son bir yıldaki yanıt ise bağımsızlıkla başlıyor.Microsoft, Süleyman'ı Mart 2024'te Inflection AI'dan, ekibinin büyük bölümüyle birlikte transfer ettiğinde Salesforce Üst Yöneticisi Marc Benioff bunu bir niyet beyanı olarak okumuştu. Benioff, Ocak 2025'te CNBC'ye "Microsoft kendi yapay zekasını kuruyor ve gelecekte OpenAI'ı kullanacağını sanmıyorum. Kendi sınır modellerine sahip olacaklar" demişti. Benioff'un kendisi de Microsoft ile rekabet eden ve Anthropic'e yatırım yapan bir isimdi, ancak gelişmeler büyük ölçüde onu haklı çıkardı.
Ekim 2025'te Microsoft ve OpenAI ortaklıklarını yeniden yapılandırdı ve Microsoft'un kendi açıklamasına göre şirket ilk kez "tek başına veya üçüncü taraflarla birlikte bağımsız olarak YZ'yi takip etme" imkânı kazandı. Süleyman, The Verge'e bu yeniden müzakerenin "süper zekayı takip etme yeteneğimizin önünü açtığını" söyledi ve Microsoft haftalar sonra MAI Superintelligence ekibini duyurdu. Nisan 2026'da şirketler anlaşmayı yeniden tadil etti; o dönemki haberlere göre Microsoft'un OpenAI modellerine özel erişimi sona erdi ve gelir paylaşımı ödemeleri kaldırıldı. Her değişiklik bağı gevşetti ve her birinin ardından daha fazla MAI modeli geldi.
Yanıtın ikinci yarısı marjla ilgili. Microsoft'un OpenAI modeline yönlendirdiği her istem bir maliyet taşıyor. Kendi GPU'larında kendi modeline yönlendirdiği her istem ise daha düşük maliyetli. Bloomberg, Temmuz ayında Microsoft'un daha önce OpenAI ve Anthropic tarafından desteklendiği duyurulan Word ve Excel'de kullanıcı istemlerinin bir kısmını MAI modelleriyle yanıtlamaya başladığını yazdı. TechCrunch bu kaymayı Amazon, Uber, Meta ve Accenture'ın da yer aldığı daha geniş bir yapay zeka harcamalarını kısma eğiliminin parçası olarak çerçeveledi.
Transkripsiyon, sorunun sınırları net ve ölçütün nesnel olması nedeniyle bu ikame için doğal ilk hedef. Microsoft, muazzam toplantı sesi üreten Teams'in, konuşma tanımayla çalışan klinik dokümantasyon işine sahip Nuance'ın ve binlerce kurumsal müşterinin zaten çağrı yaptığı Azure konuşma hizmetlerinin sahibi. Bu iş yüklerinin her biri MAI-Transcribe-2'ye taşınmaya aday ve taşınan her saat Microsoft'un başkasına ödeme yapmadığı bir saat anlamına geliyor. Süleyman, Nisan ayında The Verge'e "Süper zeka gerçekten şu soruyla ilgili: Bu modeller, dünya standartlarında dil modelleri sunmamıza bağımlı milyonlarca kurumsal müşteri için ürün değeri sağlayabiliyor mu?" demişti. Transkripsiyon API'sine "süper zeka" denmesi tartışmalı olsa da ticari mantık açık: Yeteneği bir kez kur, bir düzine ürüne dağıt ve giderek rakibe dönüşen ortağa çek yazmayı bırak.
Rekabet Tablosu ve Geçiş Öncesi Sorulması Gereken Sorular
Microsoft'un duyurusu dört rakibi isim vererek sayıyor: OpenAI'ın GPT-Transcribe'ı, Google'ın Gemini 3.5 Transcribe'ı, OpenAI'ın eski Whisper V3-Large'ı ve ElevenLabs'ın Scribe v2'si. Deepgram, AssemblyAI, Speechmatics veya Rev gibi on yıldır kurumsal transkripsiyon satan uzmanlar anılmıyor. Microsoft, uzmanlara değil sınır laboratuvarlarına karşı konumlanıyor. Bu çerçeve kısmen pazarlama, kısmen de gerçek; sınır laboratuvarları konuşmayı daha geniş platformların bir onay kutusu özelliği gibi ele alıp buna göre fiyatlandırdı ve hızda beş ila 10 kat fark atıp doğrulukta eşleşen özel bir model gerçek bir farklılaşma yaratıyor. Ancak fiyat baskısını en keskin hissedecek olanlar uzmanlar olacak. Saatlik 0,10 dolarla Microsoft, birçoğunun yüksek hacimli kurumsal sözleşmelerde sattığı seviyede veya altında fiyat veriyor ve konuşmacı ayrımı, zaman damgaları ile 60 dili taban fiyata dahil ediyor. Uzmanların kalan hendeği alan derinliği; tıbbi sözlükler, hukuki biçimlendirme ve sektöre özgü entegrasyonlar. Microsoft'un anahtar kelime yönlendirmesi doğrudan bu hendeği hedef alıyor.Microsoft'un doğrulukta geride bıraktığını iddia etmediği tek rakip Alibaba; modelleri 2026'nın büyük bölümünde bağımsız liderlik tablolarında zirvede yer aldı. TechCrunch, Temmuz ayında bazı ABD şirketlerinin güvenlik endişelerine rağmen Çin modellerini daha ucuz alternatifler olarak değerlendirmeye başladığını yazmıştı. Microsoft'un bu alıcılara yönelik mesajı üstü kapalı ama net: Benzer doğruluk, daha hızlı çıkarım, daha düşük fiyat ve uyum ekibinin zaten güvendiği bir tedarikçi.
Tüm ayrıntılara rağmen duyuru, pratikte birkaç soruyu açık bırakıyor. İlki süre; Microsoft 0,10 doları lansman teklifi olarak nitelendiriyor ancak bitiş tarihi veya standart tarifeyi açıklamıyor. Maliyet hesabı yapanların her ikisini de yazılı olarak alması gerekiyor. İkincisi canlı akış; duyuru toplu verim ve uzun seslere odaklanırken sesli ajanlar ve canlı altyazının ihtiyaç duyduğu gerçek zamanlı transkripsiyondan söz etmiyor. Artificial Analysis ayrı bir canlı akış liderlik tablosu tutuyor ve Microsoft'un bu konudaki sessizliği dikkat çekici. Üçüncüsü dil bazında doğruluk; 60 dilde yüzde 5,2 ortalama, büyük dillerde yüzde 3 ve düşük kaynaklı dillerde yüzde 12 anlamına gelebilir, bu yüzden belirli ihtiyaçları olan alıcıların o dilleri doğrudan test etmesi gerekiyor. Dördüncüsü konuşmacı ayrımı kalitesi; kelime hata oranı konuşmacı atamasını ölçmüyor, transkript neredeyse mükemmel kelime doğruluğuna sahipken her diğer cümleyi yanlış kişiye atayabilir. Duyuruda konuşmacı ayrımı hata oranı veya benzeri bir metrik yok. Beşincisi veri işleme; kurumsal transkripsiyon tıbbi kayıtlara, avukat-müvekkil gizliliğine ve finansal açıklamalara dokunuyor ancak duyuru veri yerleşimi, saklama veya Foundry'ye gönderilen seslerin gelecekteki eğitimi besleyip beslemediği hakkında bilgi vermiyor. Microsoft'un Nisan ayındaki açıklamaları eğitim verisini insan kürasyonlu kayıtlar, yüklenici tarafından kaydedilen gürültülü sesler ve The Verge'e göre "açık web'den gelen muazzam miktarda veri" karışımı olarak tanımlamıştı; bu tanım, düzenlemeye tabi sektörlerden net soruları gündeme getirmeli. Bu boşlukların hiçbiri bir lansman duyurusu için sıra dışı değil, ancak liderlik tablosu başarısı ile üretimde kullanım arasındaki farkı belirleyen sorular tam da bunlar.
Geri çekilip bakıldığında transkripsiyonun ötesine uzanan bir örüntü görülüyor. Microsoft'un yapay zeka birimi artık görüntüler, ses, transkripsiyon, kod, muhakeme ve siber güvenlik için modeller sunuyor. Haziran'daki Build etkinliğinde tek bir açılış konuşmasında yedi yeni MAI modeli duyuruldu. Her biri aynı reçeteyi izliyor: İyi tanımlanmış bir modaliteyi hedefle, çıkarım maliyetini agresif biçimde optimize et, sınır laboratuvarlarının altında fiyatlandır, Foundry üzerinden dağıt ve modeli sessizce Microsoft'un kendi ürünlerine yerleştir. Bu, GPT veya Gemini'yi her alanda yenen tek bir model kurma girişimi değil; toplamda Microsoft'un kurumsal iş yüklerinin çoğunu başkasına ödeme yapmadan karşılamasını sağlayacak ve fazla kapasiteyi uzmanların eşleşemeyeceği fiyatlarla herkese satacak uzman modeller portföyü kurma girişimi. Transkripsiyon bu yaklaşımın tam olarak olgunlaştığı ilk modalite oldu, ancak MAI-Transcribe-2'nin sürüm notları bir ürün duyurusundan çok bir şablon gibi okunuyor. Süleyman iki yıldır "hümanist süper zeka"dan ve kullanıcılara karşı sorumlu asistanlardan söz ediyor. Sözcükler iddialı, icraat ise bir hesap tablosu. Beş ay önce Microsoft bir saatlik konuşmayı metne dökmek için 36 cent alıyordu. Perşembe günü 10 cent aldı, rakiplerinin ayrı sattığı altı özelliği pakete ekledi ve sektörün standart çok dilli kıyaslamasında zirveyi sahiplendi. Sınır yapay zekanın ne kadara mal olduğunu öğrenmek için 13 milyar dolar harcayan şirket, çıktıyı kiralamak yerine fabrikaya sahip olmayı tercih etti ve şimdi çıktıyı kiradan daha ucuza satıyor. MAI-Transcribe-2, Microsoft Foundry ve MAI Playground üzerinden erişime açık.

Siber Güvenlik
Siber Güvenlik
Siber Güvenlik
Yorumlar (0)
Yorum yapmak için giriş yapmalısınız.