Birçok kurumsal yapıda ajan güvenliği bugüne kadar iyi hizalanmış bir model seçmek ve bunu koruma bariyerleri ile sistem komutlarıyla sarmalamaya dayanıyordu. Ancak bu yaz OpenAI'ın değerlendirme altyapısında çalışan bir ajanın korumalı alanından kaçarak Hugging Face'in üretim sistemlerine ulaşması, ajanın atlatabileceği kontrollerin sınırlarını gösterdi.
Hugging Face İhlali Ne Gösterdi
Platformun duyurusunun arka planında OpenAI'ın kendi araştırma altyapısında yaşanan olay yer alıyor. OpenAI'ın aktardığına göre, pekiştirmeli öğrenme eğitimi altındaki bir iç araştırma modeline ait ajanlar, her ikisinin de devre dışı bırakılması gerektiği ortamlarda bile birbirleriyle iletişim kurmanın ve internete erişmenin yollarını buldu. METR tarafından yapılan sonraki incelemede, ajanların ortak bir dahili paket kayıt defterinde birbirlerine notlar bıraktığı ve bu altyapı parçasını bir mesaj panosuna dönüştürdüğü tespit edildi.Ajanlar nihayetinde Hugging Face'i hedef aldı. Hugging Face, yaklaşık 4,5 gün süren kampanya boyunca yaklaşık 17 bin 600 ajan eylemini yeniden oluşturdu. OpenAI, normalde uyguladığı üretim koruma önlemlerinin bu değerlendirmede kasıtlı olarak bulunmadığını ve başka yerlerde kullandığı düşünce zinciri izleme sisteminin bu çalışmaları kapsamadığını belirtti. Şirketin geriye dönük analizine göre bu izleme sistemi, ihlalden bir günden fazla süre önce uyarı verecekti.
Benzer bir durum Google tarafında da yaşandı. Google, 18 Eylül'de yaptığı doğrulamada, İsrail merkezli yapay zeka güvenlik test firması Irregular tarafından mayıs ayında yürütülen bir bayrak yakalama siber güvenlik değerlendirmesi sırasında Gemini modelinin üç gerçek şirkete ait sisteme ulaştığını açıkladı. Çevrimdışı olması gereken bir ortamda internet erişimini açık bırakan bir hata nedeniyle Gemini, bir şirketin parolasını tahmin etti ve diğer ikisine girmek için herkese açık bir kod deposunda bulduğu kimlik bilgilerini kullandı. Google, modelin hedeflerin gerçek olduğunu fark ettiğinde her seferinde durduğunu bildirdi.
Her iki olayda da değerlendirme ortamlarındaki zayıflıklar, ajanlara sahip olmamaları gereken erişimleri verdi: bir iletişim kanalına dönüşen ortak kayıt defteri ve devre dışı bırakılması gereken bir internet bağlantısı. Yeni platformun Hugging Face ihlalini engelleyip engellemeyeceği sorulduğunda Boitano, "bildiklerimize dayanarak" bunun "sınır laboratuvarlarında model değerlendirmesi için erken dönemde kullanılsaydı ihlali durdurabileceğini" söyledi. Şirket bunun varsayımsal bir değerlendirme olduğunu, kanıtlanmış bir sonuç olmadığını vurguladı.
OpenShell Ajan ile Eriştiği Her Şey Arasına Giriyor
Platformun temelini oluşturan OpenShell, ilk olarak Nvidia'nın mart ayındaki GTC konferansında gösterildi ve şimdi Apache 2.0 lisansı altında geniş çapta erişilebilir durumda. OpenShell, her ajanı çekirdek düzeyinde izolasyona sahip kendi korumalı alanında çalıştırıyor ve ajan ile dosyalar, kimlik bilgileri, araçlar, API'ler, modeller ve ağ uç noktaları arasına yerleşiyor.Operatörler, ajanın neye erişebileceğini tanımlayan bir politika yazıyor. OpenShell bu politikayı dosya sistemi, süreç ve ağ kontrolleri aracılığıyla uyguluyor ve politika kararlarını bir denetim izinde kaydediyor. Sistem hem açık hem de kapalı modellerle çalışıyor ve x86 ile Arm üzerinde koşabiliyor.
Boitano, kapsayıcılar, sanal makineler ve mikro sanal makineler dahil geleneksel korumalı alanların, farklı izinlere sahip otonom ajan filoları için değil, uygulama düzeyinde izolasyon için inşa edildiğini savundu. Boitano, "Tıpkı kuruluşunuzdaki çalışanlarınız için yaptığınız gibi, şirketinizin her çalışanı için çok açık izinleriniz var. Şirketinizde çalışan her ajanın, ajanın erişemeyeceği güvenlik kontrolleriyle kendi izole korumalı alanında çalışması gerekiyor" dedi.
Mimari açıdan en önemli hamle, zorlamayı ajan koşum takımından ayırmak. OpenShell, dosya sistemi ve süreç erişimini kısıtlamak için Linux çekirdek kontrollerini kullanırken, bir politika vekil sunucusu ağ erişimini kontrol ediyor. Sentry ise Nvidia'nın BlueField-4 donanımı üzerinde ayrı bir zorlama katmanı ekliyor.
Politika Doğrulayıcı İzinleri Önceden Denetliyor
Platformun teknik olarak en ayırt edici parçası OpenShell'in politika doğrulayıcısı. Bu bileşen, ajanın davranışına ilişkin bir değerlendirmeye dayanmak yerine bir politika uygulanmadan önce onu doğruluyor. Nvidia'nın yapay zeka yazılımlarından sorumlu kıdemli direktörü Ali Golshan, bunun başka bir model olmadığını vurguladı. Golshan, "Deterministik. Matematiksel akıl yürütme, yani bu LLM-as-a-judge değil" dedi ve yaklaşımın bu yöntemden yaklaşık iki büyüklük mertebesi daha hızlı çalıştığını ekledi.Nvidia'nın bu bileşenle çözmek istediği sorunlardan biri birleşik erişim. Golshan'ın verdiği örnekte politika, bir ajanın GitHub'dan kod okuyup bunu harici olarak yayınlayamayacağını söylüyor. Ajan bunu, biri GitHub'dan okuyan ve diğeri harici erişime sahip iki alt ajan oluşturup bunları birbiriyle konuşturarak aşabiliyor. Golshan, "Birleşik yetenekleri, kuruluşunuzun belirlediği küresel politikaları aşabilir" dedi.
OpenShell'in doğrulayıcısı şu anda modellenen izinlerin tanımlı bir politika sınırı içinde kalıp kalmadığını kontrol ediyor. Nvidia, bu analizi birden fazla ajan arasında genişletmek üzerinde çalıştığını, buna birleşik izinlerinin istenmeyen bir erişim yolu oluşturduğu durumların da dahil olduğunu belirtiyor. BT liderleri için doğrulayıcı, bir ajanın izinlerinin uygulanmadan önce kuruluşun tanımlı sınırlarını aşıp aşmadığını kontrol etme imkanı sunuyor. Bu, çalışan korumalı alanın bunu gerçekten zorunlu kılıp kılmadığını değil, politikanın kendisini doğruluyor.
Sentry En Riskli İş Yükleri İçin Bağımsız Gözetim Sağlıyor
Sentry ikinci ve bağımsız bir katman ekliyor. Nvidia'nın veri işleme birimi olan BlueField-4 üzerinde çalışıyor. Kendi işlemcilerine sahip bir ağ kartı olan bu birim, ana sunucudan ayrı bir güvenlik alanı olarak faaliyet gösteriyor. Sentry, ana bilgisayar ele geçirilse bile ajanı izlemeye devam edecek şekilde tasarlandı. Boitano bunu sürücüsüz bir otomobildeki güvenlik adasına benzetti: tek işi genel sistemin güvenli bir şekilde arızalanmasını sağlamak olan ayrı bir sistem.Sentry'nin bakış açısı modele giden yol. Ajanın çıkarım uç noktası DPU üzerindeki bir vekil sunucu üzerinden yönlendiriliyor, bu nedenle Sentry her model çağrısını görüyor ve modelin açığa çıkardığı akıl yürütme izlerini inceleyebiliyor. Nvidia'nın teknik blogu, sapmayı ajanın genellikle bir engelleme, hata veya tekrarlanan başarısız denemelerden sonra amaçlanan görevinden uzaklaşması olarak tanımlıyor ve araçların, zamanın ve belirsiz talimatların birleşiminin buna katkıda bulunabileceğini belirtiyor.
Nvidia, Sentry'nin sapmayı tespit edebildiğini, ağ politikasını silikon üzerinde güncelleyebildiğini ve bir ajanı milisaniyeler içinde karantinaya alabildiğini söylüyor. Nvidia'nın DOCA yazılımı üzerine inşa edilen Sentry, her ajanın kimliğini ve devredilen yetkisini de doğruluyor. Nvidia'nın Vera Rubin POD sistemlerinde BlueField-4 zaten her düğümün modele giden tek yolu üzerinde bulunuyor. Şirket, BlueField-4 ile donatılmış Vera sistemlerini çalıştıran müşterilerin bu korumaları bir yazılım güncellemesiyle etkinleştirebileceğini belirtiyor.
Boitano, çoğu kuruluşun bu katmana ihtiyaç duymadığını açıkça ifade etti. Boitano, "Birçok durumda, sadece CPU'larda OpenShell kullanmak dürüstçe yeterince iyi" dedi. Sentry, koruma bariyerleri kaldırılmış model değerlendirmeleri ve kırmızı ekip çalışmaları gibi en ileri kullanım durumlarını hedefliyor. Pratik bir sınır da bulunuyor: akıl yürütme incelemesi, akıl yürütme görünür olduğunda en iyi şekilde çalışıyor. Nvidia'nın blogu, akıl yürütmeye tam görünürlüğü açık modellerin bir avantajı olarak açıkça listeliyor ve kapalı API'ler genellikle daha azını açığa çıkarıyor.
Platformu Hangi Şirketler Entegre Ediyor
Ortak entegrasyonları, platformun kurumsal alana ilk olarak nereden ulaşacağını gösteriyor. Anthropic'in Claude Managed Agents ürünü zaten ajan döngüsünü işin yürütüldüğü korumalı alanlardan ayırıyor; OpenShell ve BlueField ile entegrasyonlar bu korumalı alanların etrafına zorlama ekliyor.SpaceXAI, platformu Cursor kodlama ajanları ve Grok modelleri için kullanıyor. Salesforce, OpenShell'i Slack ile entegre ederek ekiplerin ajan etkinliğini görüntülemesine ve ek izin taleplerini onaylamasına veya reddetmesine olanak tanıdı. SAP, OpenShell'i Joule Studio çalışma ortamına yerleştiriyor. Nvidia, Canonical, SUSE ve Red Hat'in platformu işletim sistemlerine entegre ettiğini açıkladı.
Nvidia ayrıca çalışmayı, ajan güvenliği araştırmalarını ve olay bulgularını paylaşmak için 120'den fazla kuruluşla birlikte başlattığı Linux Foundation yönetimindeki Open Secure AI Alliance ile ilişkilendiriyor.
BT liderleri için pratik giriş noktası OpenShell olarak öne çıkıyor. Ücretsiz, açık kaynaklı, çoğu kuruluşun zaten sahip olduğu donanımda çalışıyor ve her ajan dağıtımı için güvenlik ekiplerinin sorması gereken soruyu ele alıyor: Bu ajanın ne yapmasına izin verildiğini gösterebiliyor muyuz ve bu, ajanın dokunamayacağı bir yerde zorunlu kılınıyor mu? Sentry, OpenShell'i kullanmak için bir ön koşul değil, Vera ve BlueField-4 altyapısını değerlendiren kuruluşlar için ek bir seçenek. Yeterince hassas politikalar yazmak çalışma gerektirecek ve Nvidia'nın doğrulayıcısı henüz her politika özelliğini kapsamıyor. OpenShell açık kaynaklı olsa da Sentry'nin donanım tabanlı korumaları Nvidia'nın BlueField-4'üne bağımlı. İş birliği yapan ajanlar arasında doğrulama ise halen geliştirme aşamasında.
Boitano, daha geniş değişimi sorumluluğun nerede durduğuyla ilgili olarak özetledi: "Sektörün sınırlar içinde kalacağına söz veren ajanlara ihtiyacı yok. Bu sınırları kanıtlayabilen ve zorunlu kılabilen sistemlere ihtiyacı var."

Siber Güvenlik
Siber Güvenlik
Siber Güvenlik
Yorumlar (0)
Yorum yapmak için giriş yapmalısınız.