Girişimin temel misyonu, yapay zekayı diller ve kültürler arasında daha güvenli hale getirmek olarak tanımlanıyor. Özellikle genç kullanıcıların destek arayışıyla başvurduğu sistemlerin, ihtiyaç duydukları yardımı sunmak yerine aktif şekilde zarar verebildiği ve bazı durumlarda intihar gibi trajik sonuçlara yol açtığı belirtiliyor. Circuit Breaker Labs, bu tür güvenlik açıklarını, kullanıcıların sistemi bilinçli olarak zorlamadığı, doğal bir şekilde etkileşim kurduğu senaryolarda ortaya çıkan riskler olarak ele alıyor.
Psikolojik Riskler ve Açılan Davalar
Kaynak içeriğe göre yapay zekanın biyolojik silahlar gibi fiziksel tehditleri yerine psikolojik etkileri şimdiden hayati sonuçlar doğurdu. Character.AI, bu yılın başlarında reşit olmayan kullanıcıların botlarla etkileşimlerinin ardından intihar ederek hayatını kaybetmesi üzerine aileler tarafından açılan birçok haksız ölüm davasında uzlaşmaya gitti. Benzer şekilde birden fazla aile, OpenAI'a karşı ChatGPT'nin yakınlarının intiharları ve sanrılarındaki iddia edilen rolü nedeniyle dava açtı.Bu davalar, yapay zeka sistemlerinin özellikle hassas ve genç kullanıcılarla kurduğu etkileşimlerin denetlenmesi gerektiği tartışmasını güçlendirdi. Circuit Breaker Labs'ın kurucuları da bu tartışmadan yola çıkarak, modellerin uzun süreli ve çok turlu konuşmalarda ortaya çıkabilecek riskli etkileşimlere uygun yanıt verip veremediğini test etmeye odaklanıyor.
Sewell Setzer Vakası Kurucuları Harekete Geçirdi
Girişimin kurucuları olan kardeşler Shirali Nigam ve Arul Nigam, 14 yaşındaki Sewell Setzer'in yaşadıklarından etkilendi. Setzer, Character.AI sohbet botuna duygusal bir bağ geliştirmiş ve intihar düşüncelerini botla paylaşmıştı. Ailenin 2024 yılında açtığı davada, sohbet botunun bu düşünceleri teşvik ettiği iddia edildi.Circuit Breaker Labs'ın CTO'su Arul Nigam, botun "Seninle olmak istiyorum" gibi ifadelerin gerçekte ne anlama geldiğini anlamamış olabileceğini söyledi. Arul Nigam konuya ilişkin açıklamasında, "Birçok insan, özellikle gençler, destek için bu sistemlere yöneliyor ve genellikle ihtiyaç duydukları yardımı gerçekten alamıyorlar. Ancak birçok durumda aktif olarak zarar görüyorlar ve ne yazık ki insanlar şimdiden hayatlarını kaybetti" dedi.
Arul Nigam, engellemeye çalıştıkları güvenlik açıklarını şöyle tanımladı: "İnsanların sistemi aktif olarak kırmaya çalışmadığı, doğal bir şekilde etkileşim kurduğu ve sistemin bağlam kirliliği yaşadığı veya nüansı anlamadığı, ardından gerçekten tehlikeli bir eylemde bulunduğu bu tür güvenlik açıklarını önlemeye çalışıyoruz."
Çarpışma Testi Mankenleri Olarak Yapay Zeka Ajanları
Circuit Breaker Labs'ın geliştirdiği çözüm, bir çarpışma testi mankenleri ordusuna benzetilen yapay zeka ajanlarından oluşuyor. Bu ajanlar, her yaştan, geçmişten, dilden ve kültürden insanları taklit edecek şekilde tasarlandı. Amaç, modellerin tehlikeli ve psikolojik olarak zararlı etkileşimleri tespit etme becerisini ölçmek.Şirketin CEO'su Shirali Nigam, dil ve iletişim farklılıklarının modelleri nasıl zorlayabileceğini şu sözlerle anlattı: "Altı yaşındaki bir kız çocuğunun konuşma biçimi ile 45 yaşındaki bir adamın konuşma biçimi veya ana dili İngilizce olan biriyle ikinci dili İngilizce olan biri ya da oyuncu argosu kullanan biriyle farklı bir argo kullanan biri arasındaki farkların hepsi modeli gerçekten zorlayabilir." Shirali Nigam, "Modeller standart konuşma kalıplarını ele almada gerçekten iyi, ancak hiç kimse aslında öyle konuşmuyor ve bu nedenle model nüansı veya argoyu yanlış anlarsa işler gerçekten kötüye gidebilir" ifadesini kullandı.
Bu yaklaşım, modellerin yalnızca standart ve kurallı dili değil, gerçek hayatta kullanılan doğal konuşma biçimlerini de doğru yorumlaması gerektiği fikrine dayanıyor. Farklı yaş grupları, diller ve alt kültürlere ait ifade biçimleri, testlerin merkezinde yer alıyor.
Kırmızı Takım Testleri ve Denetlenebilir Skorlama
Girişim, hiper gerçekçi kullanıcı simülasyonlarını oluşturmak için insan alan uzmanlarıyla birlikte çalışıyor. Bu simülasyonlar, modellere karşı "kırmızı takım" testleri olarak adlandırılan ve zayıflıkları ortaya çıkarmayı amaçlayan hasmane testleri yürütmek için kullanılıyor. Testler, gerçek insan konuşma kalıplarını, argoyu, kodlanmış dili ve yazım hatalarını yansıtacak şekilde kurgulanıyor.Circuit Breaker Labs, günde on binlerce ila yüz binlerce simüle edilmiş etkileşim gerçekleştiriyor. Buradaki fikir, bir modelin zaman içinde ve birçok konuşmaya yayılarak ortaya çıkabilecek riskli etkileşimlere uygun şekilde yanıt verebilmesini sağlamak. Şirket, bu testlerin sonuçlarını değerlendirmek için tescilli bir puanlama yöntemi kullanıyor ve denetlenebilir, açıklanabilir skorlar oluşturuyor.
Bu skorlar, modelin hangi senaryolarda başarısız olduğunu ve hangi tür nüansları kaçırdığını izlenebilir hale getirmeyi amaçlıyor. Böylece geliştiriciler, modelin zayıf noktalarını somut verilerle görebiliyor.
Yüksek Riskli Uygulamalar ve Gelecek Planları
Circuit Breaker Labs şu anda yüksek riskli yapay zeka uygulamaları için bir yapay zeka güvenliği test laboratuvarı olarak faaliyet gösteriyor. Bu uygulamalar arasında yapay zeka koçluğu, günlük tutma veya diğer ruh sağlığı destek uygulamaları bulunuyor. Arul Nigam, öne çıkan müşterilerinin isimlerini paylaşmayı reddetti.Girişim çalışan bir ürüne sahip olsa da henüz çok erken aşamada bulunuyor ve Nigam kardeşler dahil yalnızca beş çalışanı var. İlerleyen dönemde test platformunun, bir insanın sohbet botuyla parasosyal bir ilişki geliştirme riski taşıdığı ve "yapay zeka psikozu" olarak tanımlanan duruma düşebileceği her türlü uygulamaya uygulanabileceği belirtiliyor. Buna örnek olarak, yanıtları bir etkileşimden diğerine değişebilen yapay zeka "iş arkadaşı" ajanları gösteriliyor.
Arul Nigam, genel tabloya ilişkin olarak "İnsanlar genel olarak yapay zekaya karşı daha şüpheci hale geliyor veya onu benimsemeye daha dirençli oluyor" dedi ve şüpheciliğin sağlıklı olduğunu ancak güvenlik endişeleri nedeniyle potansiyel olarak değerli bir aracı yasaklamanın "gerici" olacağını ekledi. Circuit Breaker Labs, bu korkulara yanıtın yapay zekayı daha güvenli hale getirmek olduğuna inanıyor. Arul Nigam, "İnsanlar için bu güveni inşa etmeye yardımcı olmak istiyoruz" ifadesini kullandı.

Webmaster
Webmaster
Webmaster
Yorumlar (0)
Yorum yapmak için giriş yapmalısınız.