UNICEF Testi Yapay Zekanın Zayıf Noktasını Gözler Önüne Serdi
Projenin arka planında çarpıcı bir araştırma yatıyor. UNICEF'in baş istatistikçisi João Pedro Azevedo, sanal bir basın toplantısında altı büyük dil modelini küresel kalkınma göstergeleri üzerinde test ettiklerini açıkladı. 133.000'i aşkın yanıtı kapsayan bu kıyaslama çalışmasında modellerin ortalama doğruluk skoru yalnızca yüzde 21,2 olarak ölçüldü. Azevedo, TechCrunch'a verdiği bilgide teste dahil edilen modellerin OpenAI'ın GPT-4o ve GPT-4o-mini, Anthropic'in Claude Sonnet 4.5 ve Haiku 4.5 ile Google'ın Gemini 2.5 Flash ve Gemini 2.0 Flash olduğunu belirtti.Bulgular daha da dikkat çekici bir tablo ortaya koyuyor: Yanıtların yaklaşık beşte üçü kullanılabilir bir sayı içermedi; modeller çoğunlukla belirsiz ifadelerle yanıt verdi. Üstelik aynı sorular aynı model sürümlerine yaklaşık iki gün arayla yeniden yöneltildiğinde, her iki seferinde de sayısal yanıt veren modellerin yalnızca yarısı tutarlı sonuçlar üretti. Azevedo, söz konusu çalışmanın henüz hakemlik sürecinden geçmemiş bir UNICEF çalışma belgesi olduğunu ve akademik bir dergiye sunulmak üzere hazırlandığını belirtti. Kurum, metodoloji, kod ve verileri makaleyle birlikte kamuoyuyla paylaşmayı planlıyor.
UNICEF'in Veri Sitesine Yapay Zeka Kaynaklı Trafik Hızla Artıyor
UNICEF aynı zamanda yapay zeka asistanlarından veri sitesine yönelen trafikte bu yıl belirgin bir artış yaşandığını aktardı. Ayda 6 milyonun üzerinde ziyaret alan ve ajansın en çok ziyaret edilen siteleri arasında yer alan bu platforma ChatGPT bağlantıları aracılığıyla gelen ziyaretler, 1 Ocak-14 Eylül döneminde bir önceki yılın aynı dönemine kıyasla yüzde 67 yükseldi. Azevedo'nun TechCrunch'a aktardığı verilere göre bu tür yönlendirmeler 2025 yılında tüm oturumların yüzde 6,4'ünü oluşturdu. UNICEF'in tahminlerine göre yapay zeka asistanları artık sitenin her on ziyaretçisinden birini oluşturuyor.Platformun Kapsamı ve Teknik Altyapısı
BM'nin 26 birimi platforma dahil olmayı taahhüt etti; lansman anında yaklaşık 20 birime ait veriler erişime açıldı. BM, 2027 yılına kadar istatistik veri setlerinin yüzde 80'ini bu sisteme taşımayı hedefliyor. BM İstatistik Bölümü'nün vekil direktörü Shantanu Mukherjee, platformun ölçek, kapsam ve esneklik açısından mevcut sistemden çok daha ileri bir düzeyde olduğunu ve BM sistemi genelinde bu denli çok ajansı ilk kez bir araya getirdiğini vurguladı.Teknik altyapı açısından platform, Model Context Protocol'ü (MCP) destekliyor. Bu standart, yapay zeka sistemlerinin harici veri kaynaklarına doğrudan bağlanmasına imkân tanıyor. Google, Data Commons'ı 2018 yılında farklı kaynaklardan gelen kamuya açık veri setlerini ortak bir çerçevede düzenlemek amacıyla hayata geçirmişti. Geçen yıl ise platforma MCP desteği eklenerek yapay zeka ajanlarının istatistikleri ve kaynaklarını doğrudan sorgulayabilmesi sağlandı.
Google.org, platformun temel altyapısını kurmak için 2 milyon dolar kapasite geliştirme fonu ve teknik destek sağladı. Google'ın Data Commons ekibini yöneten Prem Ramaswami, TechCrunch'a sistemin BM'nin yönetimindeki bir sunucuda barındırıldığını ve zamanla tamamen BM tarafından işletilip ölçeklendirileceğini söyledi. Ramaswami, dağıtım sürecinde benimsedikleri "eğiticileri eğitme" yaklaşımının BM ekibinin hızla yetkinlik kazanmasını sağladığını da aktardı.
Yapay Zeka Analize Giriyor, Ama İnsan Denetimi Şart
Platform yalnızca tekil istatistiklere erişim sunmakla kalmıyor. Google, MCP aracılığıyla BM verilerine bağlanan bir yapay zeka sisteminin birden fazla göstergeyi bir araya getirerek gösterge tabloları, grafikler ve yazılı analizler oluşturabildiğini canlı bir gösteriyle ortaya koydu. Demonstrasyon kapsamında sisteme Afrika'daki ABD Başkanı'nın AIDS'e Acil Müdahale Planı'nın etkisini araştırması istendi; sistem HIV enfeksiyonları, AIDS kaynaklı ölümler ve yaşam beklentisi gibi göstergelere ilişkin BM verilerini tespit ederek bir infografik üretti.Platform ayrıca her istatistiğin kaynağını takip ederek yapay zeka sistemi aracılığıyla elde edilen verilerin orijinal BM kaynağına kadar izlenebilmesine olanak tanıyor. Ancak Ramaswami, yetkili verilere erişimin tek başına sonuçları güvenilir kılmadığı konusunda uyardı: "Modeller nüansları yanlış yorumlayabildiğinden, çıktılar alıntılanmadan veya yayımlanmadan önce mutlaka bir insan tarafından gözden geçirilmeli."

Siber Güvenlik
Siber Güvenlik
Siber Güvenlik
Yorumlar (0)
Yorum yapmak için giriş yapmalısınız.