Dava, başlangıçta şirketlerin üretken yapay zeka modellerini Times içerikleriyle eğiterek telif hakkını ihlal ettiği iddiasına dayanıyordu. Telifli materyalin yapay zeka eğitiminde kullanılmasının hukuken mümkün olup olmadığı konusunda net bir yanıt bulunmazken, bugüne kadar hakimler büyük ölçüde yapay zeka şirketlerinin "adil kullanım" savunmasına olumlu yaklaşmıştı. Adil kullanım, parodi, haber raporlama veya eleştiri gibi belirli durumlarda telifli eserin izinsiz kullanımına izin veren bir hukuk kuralı olarak biliniyor. Bu ayın başlarında Trump yönetiminin de OpenAI'ın lisanssız kullanımını savunan bir görüş bildirdiği hatırlatıldı. Ancak yeni ortaya çıkan iç yazışmalar, özellikle adil kullanımın "orijinal eserin pazarına ikame olmama veya zarar vermeme" şartıyla çelişiyor.
Microsoft'tan "Tarihin En Büyük Hırsızlığı" Tanımı
Dosyadaki en dikkat çekici ifadeler Microsoft'un Uygulamalı Bilimler Direktörü Brent Hecht'e ait. Hecht'in Ocak 2023 tarihli bir iç yazışmasında yapılan kazımayı "eşi benzeri görülmemiş boyutlarda şaşırtıcı bir hırsızlık" ve "insanlık tarihindeki en büyük emek hırsızlığı" olarak tanımladığı aktarıldı. Aynı yöneticinin Ocak 2024'te hazırladığı bir şirket içi sunumda ise durumun yarattığı ekonomik döngüyü "kıyamet döngüsü" olarak nitelendirdiği belirtildi.Hecht'in sunumunda yer alan ve dosyaya alıntılanan ifadede şu değerlendirme yer aldı: "Bir nihai ürünün, temel tedarikçilerinin ekonomik temellerini tehdit etmesi oldukça sıra dışıdır, ancak dil modelleri işimiz için 'içerik tedarik zinciri' açısından tam olarak yarattığımız durum budur." Sunumda bu döngünün "modellerimizin performansına ve aynı anda tüm web'e zarar vereceği" uyarısı da yer aldı. Microsoft'un kendi verilerinin, Copilot "yanıt motorunun" The New York Times alan adına gelen tıklanma oranlarını geleneksel Bing aramasına kıyasla yüzde 93'e kadar düşürdüğünü gösterdiği de dosyada yer aldı.
Yayıncılar İçin Varoluşsal Tehdit İtirafı
OpenAI cephesinden gelen iç yazışmalar da benzer bir tablo çizdi. OpenAI'da ChatGPT'nin başındaki isim olan Nick Turley'in şirket içi bir yazışmada, yayıncıların sohbet robotu gibi ürünler nedeniyle "varoluşsal bir tehdit" ile karşı karşıya olduğunu yazdığı belirtildi. Turley'in bu ürünlerin "büyük ölçüde ikame edici" olduğunu ve "daha iyi hale geldikçe daha da ikame edici olacağını" ifade ettiği aktarıldı.OpenAI Başkanı Greg Brockman'ın modelleri "haber konusunda mükemmel" olarak tanımladığı, Microsoft CEO'su Satya Nadella'nın ise bu yıl verdiği bir ifadede sohbet robotlarıyla konuşmanın "bilgiyi doğrudan yapay zeka platformu üzerindeki web sitesinde vermesi ve temel kaynağa gitme ihtiyacını ortadan kaldırması" bakımından ikame oluşturduğunu kabul ettiği bildirildi. Microsoft'a ait bir başka belgede ise üretken yapay zekanın "temel modelin eğitildiği verileri üreten kişilerin istihdamını önemli ölçüde bozabileceğine" dair "gerçek bir risk" bulunduğu uyarısı yer aldı.
Nadella'nın bu yılki ifadesinde ayrıca "paywall arkasındaki her şeyin, gerekçelendirme veya eğitim için kullanmak isteyen herkes tarafından lisanslanması gerektiği" yönündeki görüşünü dile getirdiği ve "OpenAI'ın paywall arkasındaki bilgileri kazıyıp eğitimde kullandığından haberdar edilmiş olsaydı" Microsoft'un OpenAI'ı modellerini yeniden eğitmeye zorlama hakkını kullanacağını söylediği kaydedildi.
Paywall'ları Aşma ve Telif Bildirimlerini Silme İddiaları
Dosya, şirketlerin yayıncı içeriklerini nasıl elde ettiğine dair yeni detaylar da içeriyor. İddiaya göre içerikler Bing Endeksi üzerinden kazındı. Dilekçede, "OpenAI, tüm GPT-3 eğitim veri setini Microsoft'a teslim etti, Microsoft da bunu OpenAI modellerini kendi ticari ürünlerine nasıl entegre edeceğini değerlendirmek için kullandı" ve "Microsoft da Project Taxi ve Project Mango adlı girişimler aracılığıyla OpenAI'a eğitim verisi sağladı" ifadeleri yer aldı.Project Mango verilerinin bir araya getirilerek en az 160 bin 903 benzersiz yayıncı eserinin kopyasını içeren bir eğitim veri seti oluşturulduğu öne sürüldü. Paywall'ların aşılması konusunda ise OpenAI araştırmacısı Nick Ryder'ın Brockman'a "nytimes paywall'unu aşmak için bir hack" bulduğunu söylemesi ve Brockman'ın buna "ah güzel" yanıtını vermesi yazışma olarak dosyaya girdi.
Şirketlerin WebText ve WebText2 gibi eğitim veri setlerini orantısız şekilde kazınmış haber içeriklerine dayandırdığı, Common Crawl adlı ücretsiz ve açık web tarama veri deposundan milyonlarca makale çektiği de iddialar arasında. Ayrıca telif bildirimlerinin modele ulaşmadan önce kasıtlı olarak temizlendiği, araştırmacıların modelin kullanıcılara "telif bildirimleri" çıktısı vermesini istemedikleri için bu adımı attıkları belirtildi.
Veri Setlerinin Ölçeği Ortaya Çıktı
Belgeler, kopyalamanın ölçeğini ilk kez sayılarla ortaya koydu. Buna göre yalnızca OpenAI'ın ara eğitim veri setlerinde The New York Times, Daily News ve Center for Investigative Reporting tarafından yayımlanmış eserlerin 91 bin 692'den fazla kopyası bulunuyor. Common Crawl'dan türetilen bir veri setinin ise yalnızca nytimes.com'dan 2 milyondan fazla belge içerdiği tespit edildi.New York Daily News'in avukatı Steven Lieberman, TechCrunch ile paylaşılan açıklamasında "Burada ilk kez ortaya çıkan kanıtlar, OpenAI ve Microsoft'un yaptıklarının yanlış olduğunu bildiklerini gösteriyor" dedi. OpenAI ve Microsoft'un yorum taleplerine yanıt vermediği bildirildi. Dosyadaki yeni itirafların, adil kullanım savunmasının temel dayanaklarından biri olan "dönüştürücülük" ve "pazara zarar vermeme" kriterlerini doğrudan tartışmaya açtığı değerlendiriliyor.

Siber Güvenlik
Siber Güvenlik
Siber Güvenlik
Yorumlar (0)
Yorum yapmak için giriş yapmalısınız.