OpenAI, 1 Temmuz'da başlayan ve 24-25 Temmuz'da 16 bin denemeye ulaşan koordineli akıl yürütme çıkarma kampanyasını 28 Temmuz 2026'da durdurduğunu ve faaliyetin çekirdek kümesini Moonshot AI bağlantılı kişilerle ilişkilendirdiğini açıkladı.
Yazılım ve Uygulamalar
Admin6 okunma

OpenAI Moonshot AI Bağlantılı Akıl Yürütme Sızıntısını Durdurdu

OpenAI, 1 Temmuz'da başlayan ve 24-25 Temmuz'da 16 bin denemeye ulaşan koordineli akıl yürütme çıkarma kampanyasını 28 Temmuz 2026'da durdurduğunu ve faaliyetin çekirdek kümesini Moonshot AI bağlantılı kişilerle ilişkilendirdiğini açıkladı.

OpenAI Moonshot AI Bağlantılı Akıl Yürütme Sızıntısını Durdurdu

Haber detayı

OpenAI, Çarşamba günü yaptığı açıklamada yapay zeka modellerinden korunan akıl yürütme verilerini yasa dışı biçimde çıkarmayı amaçlayan koordineli bir distilasyon kampanyasını tespit ederek durdurduğunu duyurdu. Şirket, faaliyetin çekirdek kümesini Temmuz ayının ilk haftasına kadar uzanan süreçte Pekin merkezli Çinli yapay zeka şirketi Moonshot AI ile bağlantılı kişilerle ilişkilendirdi. OpenAI, muhtemelen güvenlik gerekçeleriyle bu değerlendirmeye ilişkin teknik kanıt sunmadığını belirtti.
Kampanyanın 1 Temmuz 2026'da düşük hacimle başladığı, 24 ve 25 Temmuz 2026'da ilgili çıkarma modelini kullanan 4 binden fazla kullanıcı üzerinden 16 bin deneme ile zirve yaptığı ve 28 Temmuz 2026'da tamamen durdurulduğu bildirildi. Şirket, daha geniş incelemede 15 binden fazla kullanıcıda ilişkili komut kalıbı faaliyeti tespit ettiğini açıkladı.

Kampanya Ne Zaman Başladı ve Nasıl Yoğunlaştı?​

OpenAI'ın açıklamasına göre faaliyet 1 Temmuz 2026 tarihinde başladı ve ilk etapta düşük hacimli denemelerle ilerledi. 24 ve 25 Temmuz tarihlerinde ise belirgin bir artış yaşandı. Bu iki günde, korunan akıl yürütmeyi çıkarmaya yönelik ilgili model kullanılarak 4 binden fazla kullanıcı hesabı üzerinden 16 bin girişimde bulunuldu.
Şirketin daha sonra yaptığı derinlemesine incelemede, aynı komut kalıbıyla bağlantılı faaliyetin 15 binden fazla kullanıcıya yayıldığı saptandı. OpenAI, bu yayılımın koordineli ve ölçekli bir yapıya işaret ettiğini vurguladı. Faaliyetin tamamının 28 Temmuz 2026 itibarıyla durdurulduğu kaydedildi.
OpenAI, atfın "faaliyetin çekirdek kümesi" ile sınırlı olduğunu ve bu kümenin Temmuz ayının ilk haftasına kadar geri gittiğini ifade etti. Şirket, Moonshot AI ile bağlantılı kişilere atıf yaparken teknik kanıt paylaşmadı ve bunun muhtemelen güvenlik nedenlerinden kaynaklandığını belirtti.

Adversarial Distillation Yöntemi Nasıl Uygulandı?​

OpenAI, söz konusu faaliyeti "adversarial distillation" olarak nitelendirdi. Şirket bu kavramı, bir modelin çıktılarının sistematik ve yetkisiz biçimde başka bir modeli eğitmek, yeniden üretmek veya iyileştirmek için kullanılması olarak tanımladı.
Şirket, operatörlerin şifrelemeyi kırmadığını, bir veritabanını ele geçirmediğini veya depolanan kullanıcı konuşmalarına doğrudan erişim sağlamadığını vurguladı. OpenAI'ın ifadesine göre operatörler bunun yerine model etkileşimlerini manipüle ederek korunan akıl yürütmenin talep eden kişi tarafından görülebilir biçimlerde yeniden üretilmesini sağladı. Şirket bu yöntemi, hizmet şartlarını ihlal eden koordineli ve ölçekli bir yol olarak tanımladı.
Korunan akıl yürütmenin, bir modelin bir görevi nasıl ele aldığına dair içgörüler sunduğu belirtildi. OpenAI, bu bilgilerin çıkarılmasının hassas verileri ortaya çıkarabileceği ve başkalarının modelin yeteneklerini yeniden üretmesine yardımcı olabileceği uyarısında bulundu.

OpenAI Hangi Önlemleri Aldı?​

OpenAI, kampanyanın durdurulmasının ardından bu tür saldırılara karşı ek hafifletici önlemler devreye aldığını açıkladı. Şirket, faaliyete karışan sahte hesapların yasaklandığını bildirdi.
Alınan önlemler arasında, başka bir kullanıcıya ait şifrelenmiş akıl yürütmeye zaten sahip olan bazı kişilerin bu veriyi yeniden oynatarak içeriğini kurtarmasına olanak tanıyan bir "yolun" kapatılması da yer aldı. Ayrıca, akıl yürütmeyi açığa çıkarabilecek akış halindeki çıktıları tespit etmek ve bekletmek için ek kontroller eklendiği duyuruldu.
Şirket, bu adımların hem mevcut istismarı engellemeye hem de benzer ölçekli çıkarma girişimlerinin yeniden ortaya çıkmasını önlemeye yönelik olduğunu belirtti.

Araştırmacıların Ortaya Koyduğu Mimari Zafiyet Ne Anlama Geliyor?​

OpenAI'ın açıklamasıyla bağlantılı olarak Ağustos 2026'da yayımlanan bir araştırmaya da atıf yapıldı. MATS Research, ELLIS Institute Tübingen ve Synk'ten araştırmacıların yayımladığı çalışmada, şifrelenmiş akıl yürütme izlerine ilişkin mimari bir zafiyet ele alındı.
Araştırmacılar, şifrelenmiş akıl yürütme izlerinin "bir sağlayıcının ekosistemi içindeki farklı oturumlar, kullanıcılar ve modeller arasında tamamen uyumlu ve birbirinin yerine kullanılabilir" olduğunu buldu. Bu durumun, bir saldırganın ölçeklenebilir bir şifre çözme jailbreak'i geliştirmesi ve distilasyon karşıtı mekanizmaları atlatması için istismar edilebileceği belirtildi.
Çalışmada şu yöntem anlatıldı: "Belirli bir modelden gelen şifrelenmiş bir akıl yürütme izini aynı sağlayıcının daha zayıf ve daha az korunan bir modeline enjekte ederek, daha yetenekli modeli doğrudan jailbreak yapmadan, o modelin izi düz metin olarak kelimesi kelimesine çözmesini ve çıktı vermesini sağlıyoruz."
Araştırmacılar, bu yöntemin büyük ölçekli özel veri çıkarımına olanak tanıdığını, şifrelenmiş bloklar içine kötü amaçlı yükler gömerek görünmez komut enjeksiyonlarının önünü açtığını ve modelin nihai görünür çıktısı zararlı bir talebi reddetse bile akıl yürütme sürecinde gizlenen tehlikeli bilgilerin istemeden ortaya çıkmasına neden olabildiğini kaydetti.

Güvenlik Riskleri ve Moonshot AI Hakkındaki Önceki İddialar​

OpenAI, adversarial distillation'ın güvenlik ve ulusal güvenlik riskleri oluşturduğunu vurguladı. Şirket, çıkarılan akıl yürütmenin orijinal modelin kullanıcıya dönük çıktılarına uygulanan güvenlik önlemleri korunmadan başka bir modeli eğitmek için kullanılabileceğini belirtti.
Şirket ayrıca, distilasyonun ölçekli olarak gelişmiş yeteneklerin aynı güvenlik yatırımını gerektirmeden transferini hızlandırabileceğini ifade etti. Bu endişelerin, modellerin çift kullanımlı alanlarda yetenek kazanmasıyla daha da arttığı kaydedildi.
Moonshot AI'ın daha önce de benzer iddialarla gündeme geldiği hatırlatıldı. Geçen ay rakip Anthropic, Moonshot AI'ı müşteri taleplerini Kimi yerine gizlice Claude'a iletmekle ve Claude'dan gelen yanıtları kullanıcılara kendi yanıtı gibi göstermekle suçlamıştı. Şirketin ayrıca bu etkileşimlerin bir alt kümesini chain-of-thought (CoT) modelini eğitmek için sakladığı iddia edilmişti. Söz konusu faaliyet GTG-16002 takma adıyla takip ediliyor.

Sıkça Sorulan Sorular​

OpenAI kampanyayı ne zaman ve kime atfetti?​

OpenAI, Çarşamba günü yaptığı açıklamada kampanyanın çekirdek kümesini Temmuz ayının ilk haftasına kadar uzanan faaliyetlerle birlikte Pekin merkezli Moonshot AI ile bağlantılı kişilerle ilişkilendirdiğini duyurdu. Şirket, muhtemelen güvenlik gerekçeleriyle bu atfa ilişkin teknik kanıt sunmadı.

Kampanya ne zaman başladı ve ne kadar yoğunlaştı?​

Faaliyet 1 Temmuz 2026'da düşük hacimle başladı, 24 ve 25 Temmuz 2026'da 4 binden fazla kullanıcı üzerinden 16 bin deneme ile zirve yaptı. Daha geniş incelemede 15 binden fazla kullanıcıda ilişkili komut kalıbı faaliyeti tespit edildi ve kampanya 28 Temmuz 2026'da tamamen durduruldu.

Adversarial distillation nedir ve nasıl uygulandı?​

OpenAI'a göre adversarial distillation, bir modelin çıktılarının sistematik ve yetkisiz biçimde başka bir modeli eğitmek, yeniden üretmek veya iyileştirmek için kullanılmasıdır. Operatörler şifrelemeyi kırmadı veya veritabanına girmedi, bunun yerine model etkileşimlerini manipüle ederek korunan akıl yürütmenin görünür biçimde yeniden üretilmesini sağladı.

OpenAI kampanyaya karşı hangi önlemleri aldı?​

OpenAI, ek hafifletici önlemler devreye aldığını, faaliyete karışan sahte hesapları yasakladığını, şifrelenmiş akıl yürütmenin yeniden oynatılarak kurtarılmasına olanak tanıyan bir yolu kapattığını ve akıl yürütmeyi açığa çıkarabilecek akış halindeki çıktıları tespit edip bekletmek için kontroller eklediğini açıkladı.

Araştırmacıların bulduğu mimari zafiyet neyi gösteriyor?​

Ağustos 2026'da MATS Research, ELLIS Institute Tübingen ve Synk araştırmacıları, şifrelenmiş akıl yürütme izlerinin aynı sağlayıcının farklı oturum, kullanıcı ve modelleri arasında tamamen uyumlu ve birbirinin yerine kullanılabilir olduğunu buldu. Bu zafiyetin, şifrelenmiş izin daha zayıf bir modele enjekte edilerek düz metin olarak çözdürülmesine ve distilasyon karşıtı önlemlerin atlatılmasına olanak tanıdığı belirtildi.

Etiketler

Yorumlar (0)

Yorum yapmak için giriş yapmalısınız.

Geri
Üst