Virtana'nın ABD ve İngiltere araştırması, AI fabrikalarında arızaların kök nedeninin otomatik tespit edilemediğini ve bunun pahalı GPU kapasitesini atıl bıraktığını ortaya koydu.
Siber Güvenlik
Admin41 okunma

AI Ajanları Teşhis Edemediği Altyapı Arızasını Düzeltemiyor

Virtana'nın ABD ve İngiltere araştırması, AI fabrikalarında arızaların kök nedeninin otomatik tespit edilemediğini ve bunun pahalı GPU kapasitesini atıl bıraktığını ortaya koydu.

AI Ajanları Teşhis Edemediği Altyapı Arızasını Düzeltemiyor

Haber detayı

AI altyapısındaki arızalar, tek bir sistemdeki hatanın birçok farklı sistemde aynı anda belirti üretmesi nedeniyle teşhis edilmesi en zor arızalar arasında yer alıyor. Bir eğitim işi yavaşladığında GPU panosu çekişme gösterebiliyor, veri hattı durma raporu verebiliyor ve depolama sistemi G/Ç uyarıları üretmeye başlayabiliyor; her uyarı farklı bir çözüm öneriyor. Altyapı ekipleri tüm sinyalleri görse de arızanın nerede başladığını bulmak için saatler harcarken pahalı GPU kapasitesi atıl kalıyor. Virtana tarafından ABD ve İngiltere'deki kurumsal karar vericilerle yapılan AI Factory Reality Check araştırmaları, bu sorunun yaygınlığını ortaya koyuyor: ABD'deki işletmelerin %59'u ve İngiltere'deki işletmelerin %53'ü, AI iş yükü arızalarının kök nedenini altyapı alanları genelinde otomatik olarak tespit edemiyor. Virtana Başkanı ve CEO'su Paul Appleby, “Nedenselliğe ulaştığınızda düzeltme yapabilirsiniz. Nedenselliğe ulaşamazsanız, ne olduğunu ve nasıl düzeltileceğini anlamak için duvara dart atıyorsunuz” diyor.

Ölçek Arızaların İzini Sürmeyi Zorlaştırıyor​

Yönetim kurullarından gelen AI ilerlemesini kurulu altyapı üzerinden gösterme baskısı, birçok şirketin önce altyapıyı kurup ölçümlemeyi sonraya bırakmasına neden oluyor. Bu ölçümlemenin büyük kısmını üstlenen mevcut araçlar ise kararlı, sınırları belirli ve öngörülebilir hizmet topolojilerine sahip sistemleri varsayıyor. Oysa bir AI fabrikasında zamanlayıcılar iş yüklerini hibrit ortamlar arasında sürekli taşıyor ve kaynak tüketimi doğrusal olmayan ani yükseliş ve düşüşlerle değişiyor.
Eşik tabanlı uyarı sistemlerinin çalışması için normal performansa dair bir temel değere ihtiyaç var. Ancak ABD'deki işletmelerin %66'sı AI altyapısını güvenilir performans temel değerleri olmadan çalıştırıyor. AI iş yükü performansını “yüksek derecede öngörülebilir” olarak tanımlayanların oranı ABD'de %34, İngiltere'de %26 seviyesinde kalıyor. Bu oran, 50 binden fazla çalışanı olan ABD kuruluşlarında %25'e düşüyor. Bu da en büyük AI fabrikalarını işleten şirketlerin, bu fabrikaların bir sonraki adımda ne yapacağını öngörme yeteneğinin en düşük olduğu anlamına geliyor.
Premium AI donanım maliyetlerini kontrol altında tutmak için her iki ülkedeki işletmeler de iş yüklerini hibrit ortamlarda yeniden dengeliyor ve birim başına verimliliği artırmak için sistemleri konsolide ediyor. Tüm bu hamleler sistemler yük altındayken yapılıyor ve yığın genelinde bağımlılıkları ile kaynak çekişmesini değiştiriyor. Appleby, “Sistem düzeyinde gözlemlenebilirlik olmadan, kuruluşlar bu değişikliklerin sonuçları, maliyeti veya güvenilirliği nasıl etkilediğini belirleyemez. AI sistemlerini tam olarak anlamadan sürekli optimize ediyorlar ve her değişiklikle risk ortaya çıkarıyorlar” ifadesini kullanıyor.

Kök Neden Analizi İçin Bütüncül Model Gerekiyor​

Kök neden analizi, dağıtık bir sistemde uyarının nereden kaynaklandığını belirlemek zorunda. AI fabrikasında bu, GPU'lar, CPU'lar, bellek, depolama, ağlar, orkestrasyon ve veri hatları genelinde aynı anda arama yapmak anlamına geliyor. İngiltere'deki tablo, otomatik tespit ile otomatik teşhis arasındaki farkı net biçimde gösteriyor. İşletmelerin %75'i bir AI iş yükü arızasına ilk yanıt olarak otomatik uyarıya güvenirken, yalnızca %47'si tüm altyapı alanlarında kök nedeni otomatik olarak belirleyebiliyor. Geri kalan kısım yalnızca tek bir alanı görebiliyor, sinyalleri araçlar arasında elle ilişkilendiriyor veya birden fazla ekibi saatlerce ya da günlerce bir araya getiriyor. ABD'de ise işletmelerin %25'i olay müdahalesine birbirinden kopuk konsollar arasında manuel incelemeyle başlıyor.
Appleby bu kopukluğu bir örnekle anlatıyor: “Bir depolama darboğazı veri hattını yavaşlatıyor, bu da bir eğitim işini durduruyor ve bu da GPU çekişmesi üretiyor. Eski izleme sistemleri üç ayrı alanda üç ayrı olay kaydediyor. Her olay teknik olarak doğru ve hiçbiri gerçekte ne olduğunu tanımlamıyor.” Her alana ayrı ayrı ölçümleme eklemek bu üç olayı birbirine bağlamıyor. İhtiyaç duyulan şey, orkestrasyon ve uygulama davranışı da dahil olmak üzere her alandan gelen sürekli ve yüksek doğruluklu telemetriyi gerçek zamanlı olarak ilişkilendiren, AI yürütme sisteminin tamamına dair birleşik bir operasyonel model. Bu modelin aynı zamanda iş yüklerinin, hizmetlerin ve altyapının birbirine nasıl bağlı olduğuna dair canlı bir topolojiyi koruması gerekiyor. Bu topoloji, GPU çekişmesini onu başlatan depolama darboğazına kadar izlemeyi mümkün kılıyor. Zamanlayıcı bir iş yükünü her taşıdığında topoloji değiştiği için modelin de sürekli güncellenmesi şart.
Her iki ülkedeki liderler, ihtiyaç duyulan yetenekler arasında AI ve altyapı genelinde birleşik görünürlüğü birinci sıraya, manuel ilişkilendirme olmadan AI destekli kök neden analizini ise ikinci sıraya koydu. Bu iki seçenek her rol grubunda ve her gelir diliminde ilk sırada yer aldı. Gözlemlenebilirlik zaten milyarlarca dolarlık bir pazar olmasına rağmen, alana özgü izleme araçları eklemek, araştırmanın işaret ettiği alanlar arası görünürlük ve nedensellik sorunlarını çözmüyor.

AI Ajanları Önce Nedenselliğe İhtiyaç Duyuyor​

Büyük AI fabrikalarının otonom müdahaleye ihtiyaç duyacağı belirtiliyor, çünkü bu ortamların işlem hacmi ve karmaşıklığı manuel koordinasyonun güvenilir biçimde yönetebileceğinin ötesine geçmiş durumda. İngiltere'de AI iş yüklerini günlük olarak çalıştıran altyapı ve site güvenilirliği mühendisliği (SRE) uygulayıcılarının yalnızca %23'ü performansı yüksek derecede öngörülebilir olarak tanımlıyor. Appleby, işletmelerin herhangi bir ajan bu sistemler üzerinde işlem yapmadan önce telemetri ve canlı topoloji modelini yerine koyması gerektiğini vurguluyor.
Appleby, “Bu temel olmadan, AI ajanları insan operatörleri kısıtlayan aynı kör noktaları devralır ve bu arızaları makine hızında büyütür. Eksik sistem bağlamıyla hareket eden bir ajan olayları daha hızlı çözmez, yenilerini yaratır” diyor. Virtana bu yaklaşımı Agentic Observability platformu üzerinden uyguluyor. Platform, şirket içi, sanallaştırılmış ve genel bulut ortamları genelinde AI yürütme yığınının tamamına dair ortak bir model tutuyor. Otonom ajanları GPU kullanımı, token talebi, model davranışı ve altyapı performansını gerçek zamanlı olarak ilişkilendiriyor ve her kök neden bulgusunu kanıtla destekliyor.

Maliyet, Denetim ve Yönetişim Aynı Telemetriye Bağlı​

Her iki ülkede de işletmelerin %31'i daha fazla ölçeklendirme için en önemli ön koşul olarak mevcut AI yatırımlarından daha net yatırım getirisi metriklerini gösteriyor. Appleby, “GPU kullanımını, iş yükü başına maliyeti ve verimliliği altyapı düzeyinde ölçemeyen kuruluşlar daha fazla yatırım için gerekçe oluşturamaz. Harcamayı gözlemleyebilirler ama yönetemezler” diyor.
Yöneticiler ile AI altyapısını işleten mühendisler, kuruluşlarının arızaları teşhis edip edemediği konusunda farklı yanıtlar veriyor. İngiltere'de yöneticilerin %59'u kuruluşlarının tüm altyapı alanlarında kök nedeni otomatik olarak tespit ettiğini söylerken, uyarılara müdahale eden altyapı ve SRE mühendislerinde bu oran %34'te kalıyor. Bu fark ABD'deki araştırmada bulunandan daha geniş. Çoğu İngiltere kuruluşunda AI yatırımı üzerinde nihai yetkiye sahip olan BT liderliği, teşhis konusunda en yüksek güveni bildiren grup. Bu durum bir yönetişim sorunu yaratıyor, çünkü AI bütçelerini onaylayan kişiler, kendi mühendislerinin paylaşmadığı bir teşhis hazırlığı değerlendirmesi üzerinden hareket ediyor.
İngiltere'deki işletmeler ayrıca AI'ı İngiltere GDPR'ı ve finansal hizmetler, sağlık ile kritik ulusal altyapıdaki sektörel denetim çerçeveleri altında devreye alıyor ve bu çerçeveler denetim izleri ile maliyet ilişkilendirmesi gerektiriyor. Buna rağmen İngiltere'deki işletmelerin %39'u AI fabrika talepleri arttıkça güvenlik ve uyumluluk incelemelerini önceliklendirmekten vazgeçiyor. Appleby, “Bir AI fabrikasının performans gösterdiğini kanıtlayan sistem, aynı zamanda bir düzenleyiciyi, denetçiyi veya yönetim kurulu soruşturmasını tatmin eden sistemdir. Gözlemlenebilirlik olmadan egemenlik, kanıtlanamayan bir iddiadır” diyor ve egemenliğin ABD dışında daha büyük bir AI meselesi haline geleceğini belirtiyor.

Kurumsal AI Fabrikaları Sanılandan Daha Erken Aşamada​

Kamuoyundaki anlatı, Global 2000 şirketlerinin AI'ı büyük ölçekte benimsediği yönünde olsa da en büyük AI altyapı yatırımlarının çoğu hiper ölçekleyicilerden ve bulut platformlarından geliyor. Appleby, “Yatırım düzeyinin gösterdiğinden daha erken bir aşamadayız. Dünyanın hiçbir yerinde endüstriyel ölçekte AI hizmetleri kurmuş, ölçeklendirmiş, devreye almış ve verimli biçimde işleten çok fazla büyük kurumsal örnek yok” diyor.
Ancak görünürlük ve kontrolü tesis etmeden kapasite ekleyen bir işletme, zaten sahip olduğu operasyonel sorunların daha büyük ve daha pahalı bir versiyonunu inşa etmiş oluyor. Appleby, “Altına hücum çok büyük hizmet sağlayıcılarda yaşanıyor. Büyük işletmeler için ise işi doğru yapma fırsatı hala mevcut” değerlendirmesini yapıyor.

Sıkça Sorulan Sorular​

AI altyapı arızalarını teşhis etmek neden zor?​

Kaynağa göre bir sistemdeki hata birçok sistemde aynı anda belirti üretiyor. Eğitim işi yavaşladığında GPU çekişmesi, veri hattında durma ve depolamada G/Ç uyarıları aynı anda görülebiliyor ve her uyarı farklı bir çözümü işaret ettiği için ekipler arızanın başlangıç noktasını bulmakta zorlanıyor.

Virtana araştırması kök neden tespiti hakkında ne buldu?​

Virtana'nın AI Factory Reality Check anketlerine göre ABD'deki işletmelerin %59'u ve İngiltere'deki işletmelerin %53'ü AI iş yükü arızalarının kök nedenini altyapı alanları genelinde otomatik olarak belirleyemiyor. İngiltere'de %75 otomatik uyarıya güvenirken yalnızca %47'si kök nedeni otomatik tespit edebiliyor.

Ölçek ve hibrit ortamlar arıza takibini nasıl etkiliyor?​

Kaynakta, zamanlayıcıların iş yüklerini hibrit ortamlarda sürekli taşıdığı ve kaynak tüketiminin doğrusal olmayan ani değişimler gösterdiği belirtiliyor. Eşik tabanlı uyarı için gereken güvenilir performans temel değerleri ABD'deki işletmelerin %66'sında bulunmuyor ve bu durum öngörülebilirliği düşürüyor.

AI ajanları neden nedensellik olmadan düzeltme yapamıyor?​

Paul Appleby'ye göre telemetri ve canlı topoloji modeli olmadan çalışan AI ajanları, insan operatörlerin kör noktalarını devralıyor ve arızaları makine hızında büyütüyor. Eksik sistem bağlamıyla hareket eden bir ajan olayları daha hızlı çözmek yerine yeni olaylar yaratıyor.

Yöneticiler ile mühendisler arasındaki teşhis algısı farkı nedir?​

İngiltere'de yöneticilerin %59'u kuruluşlarının kök nedeni otomatik tespit ettiğini söylerken, altyapı ve SRE mühendislerinde bu oran %34. Kaynak bu farkı yönetişim sorunu olarak tanımlıyor çünkü bütçe onayını veren BT liderliği, sahadaki mühendislerin paylaşmadığı bir güven düzeyine sahip.

Etiketler

Yorumlar (0)

Yorum yapmak için giriş yapmalısınız.

Geri
Üst