Suno'nun bu hamlesi, platformun bugüne kadar müzik odaklı kimliğini korurken ifade biçimlerini genişletme vizyonunun bir parçası olarak duyuruldu. Şirketin ürün direktörü Jack Brody, duyuruda müziğin her zaman Suno'nun merkezinde olacağını vurgularken, vizyonlarının başından beri diğer insan ifade biçimlerini de kapsadığını belirtti. Brody, Speech için "Suno'da mümkün olanı genişletiyoruz. Speech, ses ve müziği tek bir uyumlu parça olarak birlikte üreten ilk ses modeli" ifadesini kullandı.
Suno Speech Nedir ve Ne Sunuyor?
Speech, Suno'nun web ve mobil platformlarında yer alan yeni bir ses üretim modeli olarak tanıtıldı. Özellik, kullanıcıların yazdığı senaryolara veya yaptığı tanımlamalara göre konuşma sesleri oluşturuyor. En dikkat çekici yönü ise konuşma sesini ve arka plan müziğini ayrı ayrı değil, birlikte ve uyumlu bir bütün olarak üretmesi.Bu yaklaşım, Suno'nun metinden konuşmaya araçlarına getirdiği kendi yorumu olarak öne çıkıyor. Sistem, seslendirme ile müziği eş zamanlı üretirken, kullanıcı isterse arka plan müziğini bir geçiş düğmesi ile kolayca kapatabiliyor. Böylece yalnızca temiz bir konuşma sesi elde etmek de mümkün oluyor. Birlikte üretim fikri, özellikle üretken konuşma metinlerinin kullanım senaryolarını tamamlamayı hedefliyor.
Suno, bu senaryolara örnek olarak şiirler için sakinleştirici bir film müziği eşliğini, dramatik seslendirmeler ve teşvik edici konuşmalar için ise daha enerjik bir arka planı gösteriyor. Bu sayede konuşma içeriğinin tonuna ve amacına uygun bir müzikal atmosferin otomatik olarak oluşturulması amaçlanıyor.
Simple ve Advanced Modları Nasıl Çalışıyor?
Speech özelliğini kullanmak için Suno arayüzünde "Create" sekmesini seçip Speech seçeneğine gitmek gerekiyor. Özellik iki farklı kullanım modu sunuyor. Simple modu, kullanıcıların ne oluşturmak istediklerini sağlanan komut kutusu üzerinden tanımlamalarına olanak tanıyor. Bu moda örnek olarak "mürettebatını toplayan bir korsan kaptan" gibi bir tanımlama veriliyor.Advanced modu ise ne söyletmek istediğini tam olarak bilen kullanıcılar için tasarlandı. Bu modda kullanıcı kendi özel senaryosunu ekleyebiliyor ve modelin bu metni seslendirmesini sağlayabiliyor. Advanced ayarları, ses üretimi üzerinde daha fazla kontrol sunuyor. Bu ayarlar arasında yapay sesin cinsiyetini ayarlama, konuşma stilini belirleme ve her ses üretiminin ne kadar çeşitlilik içereceğini düzenleme seçenekleri bulunuyor.
Her iki mod da aynı temel amaca hizmet ediyor: Kullanıcının ya bir tanımla ya da doğrudan bir metinle istediği konuşmayı oluşturması. Simple modu daha çok fikir ve atmosfer tarifine dayanırken, Advanced modu metne sadık bir seslendirme üretmek isteyenler için ayrıntılı kontrol sağlıyor. Suno, bu iki modla hem hızlı denemeler yapmak isteyenlere hem de belirli bir metni seslendirmek isteyenlere hitap etmeyi hedefliyor.
ElevenLabs Rekabeti ve Suno'nun Çeşitlenme Stratejisi
Yapay zeka ile konuşma üretimi yeni bir alan değil. Kaynak içerikte DeepMind'ın on yıldır derin öğrenme tabanlı konuşma sentezi üzerine deneyler yaptığı, Adobe'nin bir metinden konuşmaya aracına sahip olduğu ve ElevenLabs'ın 2023'teki lansmanından bu yana bu alanda en bilinen platformlardan biri haline geldiği hatırlatılıyor.Suno'nun bu alana girişi, mevcut metinden konuşmaya araçları arasına katılması olarak değerlendiriliyor. Şirketin bu adımı, platformu çeşitlendirme girişimi olarak yorumlanıyor. Bu yorumun dayanağı olarak da Suno'nun müzik üretim aracının çok sayıda davayı üzerine çekmiş olması gösteriliyor. Suno'nun ses ve müziği birlikte üreten modeli, bu rekabetçi alanda farklılaşma çabası olarak öne çıkıyor.
Özetle Suno, ElevenLabs gibi yerleşik oyuncuların bulunduğu bir alana, müzikle konuşmayı birleştiren bütünleşik üretim yaklaşımıyla dahil oluyor. Bu sayede yalnızca konuşma sesi değil, konuşmaya eşlik eden müziği de aynı model içinde sunarak kullanım senaryolarını genişletmeyi amaçlıyor.
Beta Süreci, Süre Sınırı ve Mevcut Kısıtlar
Speech şu anda public beta olarak sunuluyor ve maksimum süresi yaklaşık sekiz dakika ile sınırlı. Suno, özelliğin henüz mükemmel olmaktan uzak olduğunu açıkça kabul ediyor ve kullanıcı geri bildirimleri doğrultusunda Speech'i geliştirmeye devam edeceğini belirtiyor.Ürün direktörü Jack Brody, beta sürecine ilişkin olarak "Beta gerçekten beta demek" ifadesini kullandı. Brody, mevcut kısıtlara örnek olarak İngiliz aksanlarının zaman zaman Avustralya aksanına kayıp geri dönebilmesini ve dramatik duraklamaların çok dramatik olabilmesini gösterdi. Ayrıca kullanıcıların, şirketin hiç aklına gelmemiş kullanım alanlarını kesinlikle keşfedeceklerini de sözlerine ekledi.
Bu açıklamalar, modelin aksan tutarlılığı ve duraklama zamanlaması gibi konularda dalgalanmalar yaşayabileceğini gösteriyor. Suno, bu tür beta sürecine özgü aksaklıkların geri bildirimlerle iyileştirileceğini ve özelliğin zamanla daha kararlı hale geleceğini ifade ediyor.

Yapay Zekâ
Yapay Zekâ
Yapay Zekâ
Yorumlar (0)
Yorum yapmak için giriş yapmalısınız.