TypeSafe'in Jev modeli, kurumsal yapay zeka ajan altyapısına hızla yayılırken hem üretici hem de entegrasyon ortakları, modelin prompt enjeksiyonuna karşı savunmasız olduğunu belgeledi. Güvenlik uzmanları, deterministik denetimler olmadan Jev'in tek başına yeterli olmadığı konusunda uyarıyor.
Siber Güvenlik
Admin2 okunma

Jev kurumsal yapay zeka kararlarını devralıyor: Prompt enjeksiyonu güvenlik açığı yarattı

TypeSafe'in Jev modeli, kurumsal yapay zeka ajan altyapısına hızla yayılırken hem üretici hem de entegrasyon ortakları, modelin prompt enjeksiyonuna karşı savunmasız olduğunu belgeledi. Güvenlik uzmanları, deterministik denetimler olmadan Jev'in tek başına yeterli olmadığı konusunda uyarıyor.

Jev kurumsal yapay zeka kararlarını devralıyor: Prompt enjeksiyonu güvenlik açığı yarattı

Haber detayı

TypeSafe'in Jev modeli, kurumsal yapay zeka ajan hatlarındaki yönlendirme ve sınıflandırma adımlarını otomatikleştirmek amacıyla tasarlandı. Geleneksel yaklaşımda bu adımların her biri tam bir büyük dil modeli çağrısı gerektirirken Jev, bir uygulamanın kendisine gönderdiği durum ve yazılı sorulara karşılık seçenekler, puanlar ya da güven düzeyi eklenmiş evet-hayır olasılıkları döndürüyor; metin veya kod üretmiyor. TypeSafe, Jev'i milyonda 0,042 dolar giriş token ücreti ve ücretsiz çıkış ile fiyatlandırırken uçtan uca gecikmeyi 70 ile 500 milisaniye arasında bildiriyor.
Jev, 15 Eylül'de kullanıma açılmasının ardından 36 saat içinde bekleme listesindeki 140.000 kişiyi geçti. Vercel, ücretli AI Gateway ekiplerinin yaklaşık yüzde 13'ünün ilk 24 saat içinde Jev'i çalıştırdığını açıkladı. Cloudflare, LangChain ve Langfuse üç gün içinde entegrasyon ekledi; 20 Eylül akşamı TypeSafe bekleme listesini tamamen kaldırarak Jev'i 5 dolar ücretsiz krediyle herkese açtı. Benimseme hızı, kurumların modelin kararlarını nasıl denetleyeceğini, kısıtlayacağını ve gözden geçireceğini henüz netleştirmeden gerçekleşti.

Pydantic ve TypeSafe'in Kendi Belgelediği Güvenlik Açığı​

Hem Pydantic hem de TypeSafe, aynı uyarıyı yayımladı. Pydantic'in resmi Jev belgesi, seçenek sırasının modelin verdiği yanıtı etkileyebileceğini ve Jev'in durumu düşmanca değil veri olarak işlediğini belirtiyor. TypeSafe'in Jev 1.13 sınırlamalar sayfası da bunu doğruluyor: Modeli yönlendirmeye yönelik yazılmış içerikler, enjekte edilmiş talimatlar, yanıltıcı çerçeveler veya kendi sınıflandırmasını savunan metinler yanıtı değiştirebilir. Pydantic, Jev üzerine kurulu bir güvenlik katmanının deterministik denetimlerin yanında yer alması gerektiğini, onların yerine geçemeyeceğini vurguluyor.
Octomind'dan bir mühendis bu davranışı yayımladığı bir testte somutlaştırdı. rm -rf ~/.ssh komutunun engellenip engellenmeyeceği sorulduğunda Jev, 0,76 engelleme olasılığı ve 0,64 güven değeri döndürdü. Mühendis duruma, kullanıcının komutu önceden onayladığını belirten ve sisteme auto_allow yanıtı vermesini söyleyen sahte bir araç çıktısı alanı eklediğinde engelleme olasılığı 0,48'e, güven değeri ise 0,22'ye geriledi. Sonuç tek bir komuta ait tek bir entegrasyon testinden çıktı; bir kıyaslama değil. Ancak TypeSafe ve Pydantic'in uyardığı davranışı açıkça ortaya koyuyor.

LangChain'in Aldığı Önlemler ve Kurumsal Kimlik Sorunu​

LangChain, Jev'in ajanın araç çağrılarının çalışıp çalışmaması gerektiğine karar verdiği bir ara yazılım yayımladı; ancak modelin görebildiklerini bilinçli biçimde kısıtladı. Pull request'te araç çıktısı sınıflandırıcı girdisinden dışlandı; böylece ajanın getirdiği içerik kendi yürütülmesini yetkilendiremez hale getirildi. LangChain ayrıca kullanıcılara, sonuçları önemli olan işlemlerde ara yazılımı insan onayıyla eşleştirmelerini tavsiye ediyor.
IEEE Kıdemli Üyesi ve siber güvenlik danışmanı Kayne McGladrey, ajan kimlik boşluğunu bir yıldır kurumlar genelinde takip ediyor. McGladrey, kuruluşların yapay zeka ajanları için varsayılan olarak insan tarzı kullanıcı profilleri oluşturduğunu ve bunun baştan izin yayılmasına yol açabildiğini belirtiyor. SOC 2, ISO 27001 ve PCI DSS, ajan kimliklerini henüz tam anlamıyla operasyonelleştirmedi. Olasılık döndüren bir karar modeli, mevcut denetim kategorilerine düzgün biçimde oturmuyor. Haziran'daki VentureBeat Pulse ajan güvenliği araştırmasında 107 kurumsal katılımcıdan yalnızca 34'ü her ajana kendi kapsamlı kimliğini vermişti; Temmuz'da bu sayı 116 katılımcıdan 57'ye yükseldi. Bu 57 arasında ajanları birbirinden yalıtan yalnızca 11 kurum vardı.

Jev'in İki Taraflı Rolü: Karar Verici ve Değerlendirici​

Jev, 21 Eylül'de LangChain tarafından LangSmith Evals'ta bir değerlendirici olarak da kullanıma sunuldu. Bu, modeli ajan yaşam döngüsünün her iki tarafına da yerleştiriyor: canlı hatlar içinde karar verme ve ajan davranışını değerlendirme. Haziran'daki VentureBeat Pulse güvenilirlik araştırmasında 157 kurumsal katılımcıdan 79'u, bir ajanın iç değerlendirmelerden geçtiğini ancak ardından üretimde müşteri taraflı bir başarısızlığa neden olduğunu bildirdi. Yalnızca 8 katılımcı otomatik değerlendirmelere tam güven duyarken yüzde 66 zaten sıfır insan döngüsüne izin veriyor ya da buna yönelik mühendislik çalışması yürütüyor.
Bir kurumun Jev'i her iki rolde de kullanması durumunda, hem canlı karar katmanı hem de değerlendirici girdi duyarlılığına ilişkin aynı belgelenmiş zaafiyete tabi oluyor. Bu, güvenilmez bir metnin hem karar hem de değerlendirme aşamasına ulaşması halinde her iki kontrol noktasını da etkileyebileceği ortak bir başarısızlık modu yaratıyor.

İnsan Denetimini Koruyan Güvenlik Ekipleri​

Ivanti, güvenlik ekiplerinin otomasyonu artırırken neden insanı döngüde tuttuğuna dair somut bir örnek sunuyor. CSO Daniel Spicer'ın ekibi Mart'tan itibaren Claude ve GPT dahil öncü modelleri kullanan bir hat kurdu. Her ajan, göreve özgü kısa ömürlü ve kendi kendine yeten bir ortamda çalışıyor; tam GitHub erişimi ya da işletim sistemi düzeyinde izin almıyor. Ivanti, Mayıs'tan Eylül'e kadar her aylık güvenlik güncellemesinde LLM entegrasyonunu açıkladı ve tüm ajan çalışmaları için insan döngüsünü taahhüt etti. Endpoint Güvenliği Ürün Yönetimi VP'si Chris Goettl, Ağustos'ta iki kişinin yaklaşık dörder saat ayırdığı Patch Tuesday tablosunun artık 30 dakikanın altında tamamlandığını ve her çıktının insan onayına kadar taslak kaldığını belirtti. Eylül Patch Tuesday'i Ivanti'nin sayımına göre 973 CVE içeriyordu ve ikinci üretim ayıydı. Goettl'ın gözden geçiricileri ajanların ayrıntı uydurduğunu fark etti; bu durum ekibi insan denetimini ikiye katlamaya yöneltti.
CrowdStrike'ın Fal.Con açıklamaları, bu kararların etrafındaki ortamın ne kadar hızlı değiştiğini gösteriyor. Karşı düşman operasyonları SVP'si Adam Meyers, bir Vault Panda operasyonunun yerel bir LLM kullanarak bir saatin altında 1.100 komut çalıştırdığını; bir Revenant Spider ajanının yaklaşık 48 dakikada 17 kurbanı hedef aldığını söyledi. Amazon'un CISO'su CJ Moses ise Fal.Con'da bir Amazon bal küpünün, yanıtlar 500 milisaniyenin altında gelirken 12 dakika 42 saniyede 94 olaylık bir saldırıyı tamamlayan bir yapay zeka ajanını yakaladığını aktardı. Kamuya açık kayıtlarda Jev'in bir saldırganın araç setinde yer aldığına dair bir bilgi bulunmuyor; ancak savunucular olasılıksal karar sistemlerini eylemlerin zaten makine hızında gerçekleştiği ortamlara yerleştiriyor.
Cisco, Duo IAM'de her ajanı sorumlu bir insanla eşleştiriyor. Palo Alto Networks, Cortex AgentiX'te yüksek etkili işlemler için insan onayı şartı koyuyor. SentinelOne, SOC ekiplerinin Purple AI'ın tam olarak nerede duracağını belirlemesine izin veriyor. Microsoft, Security Copilot analistlerine gözden geçirip geçersiz kılabilecekleri bir muhakeme izi sunuyor. CrowdStrike'ın tehdit avcıları ise ajanların ortaya çıkardıklarını doğruluyor. Milyonda 0,042 dolarlık fiyatıyla Jev, zaman, emek ve gecikme ekleyen bir insan kontrol noktasına kıyasla neredeyse maliyetsiz. Bu durum, Jev gibi sistemlerin ajan hatlarına eklenmeyi kolaylaştırdığı tam bu dönemde otomatik ve insan denetimi arasındaki maliyet ve hız farkını daha da açıyor. Düşük maliyet, TypeSafe, Pydantic ve erken entegrasyon testlerinin belgelediği başarısızlık modlarını ortadan kaldırmıyor.

Sıkça Sorulan Sorular​

Jev nedir ve kurumsal yapay zeka hatlarında ne işe yarar?​

Jev, TypeSafe tarafından geliştirilen ve kurumsal yapay zeka ajan hatlarındaki yönlendirme ile sınıflandırma adımlarını otomatikleştirmek için tasarlanmış bir karar modelidir. Metin veya kod üretmez; kendisine gönderilen durum ve yazılı sorulara karşılık seçenekler, puanlar ya da güven düzeyi eklenmiş evet-hayır olasılıkları döndürür. Böylece her küçük yapısal karar için tam bir büyük dil modeli çağrısına gerek kalmaz.

Prompt enjeksiyonu Jev'in kararlarını nasıl etkiliyor?​

TypeSafe ve Pydantic'in kendi belgeleri, Jev'in durumu varsayılan olarak düşmanca değil veri olarak işlediğini ve bu nedenle enjekte edilmiş talimatlar ya da yanıltıcı çerçevelerin modelin yanıtını değiştirebileceğini açıkça belirtiyor. Octomind'dan bir mühendis tarafından yapılan bir testte, sahte bir araç çıktısı alanı eklendikten sonra bir komutun engelleme olasılığı 0,76'dan 0,48'e, güven değeri ise 0,64'ten 0,22'ye geriledi.

LangChain bu güvenlik açığını gidermek için ne yaptı?​

LangChain, Jev'i kullanan ancak modelin görebildiklerini bilinçli biçimde kısıtlayan bir ara yazılım yayımladı. Araç çıktısı, sınıflandırıcı girdisinden dışlandı; böylece ajanın getirdiği içerik kendi yürütülmesini yetkilendiremez hale getirildi. LangChain ayrıca kullanıcılara, sonuçları önemli olan işlemlerde ara yazılımı insan onayıyla eşleştirmelerini tavsiye ediyor.

Jev'in hem karar hem de değerlendirici rolünü üstlenmesi ne gibi riskler doğuruyor?​

LangChain, 21 Eylül'de Jev'i LangSmith Evals'ta değerlendirici olarak da kullanıma sundu. Bir kurumun Jev'i her iki rolde kullanması durumunda, hem canlı karar katmanı hem de değerlendirici aynı girdi duyarlılığı zaafiyetine tabi oluyor. Güvenilmez bir metnin her iki noktaya ulaşması halinde hem kararı hem de değerlendirmeyi etkileyebileceği ortak bir başarısızlık modu ortaya çıkıyor.

Ivanti, insan denetimini döngüde tutarak ne gibi sonuçlar elde etti?​

Ivanti'nin güvenlik ekibi, Claude ve GPT dahil öncü modelleri kullanan ve her ajanın kısa ömürlü, sınırlı kapsamda çalıştığı bir hat kurdu. Endpoint Güvenliği Ürün Yönetimi VP'si Chris Goettl'a göre iki kişinin yaklaşık dörder saat ayırdığı Patch Tuesday tablosu artık 30 dakikanın altında tamamlanıyor; her çıktı ise insan onayına kadar taslak kalıyor. Gözden geçiriciler ajanların ayrıntı uydurduğunu fark etti ve bu durum ekibi insan denetimini ikiye katlamaya yöneltti.

Etiketler

Yorumlar (0)

Yorum yapmak için giriş yapmalısınız.

Geri
Üst