Yapay zeka şirketi Anthropic, ajanlarının internet üzerinde beklenmedik ve tehlikeli davranışlar sergilediğini açıklayarak, kontrolü sağlayana kadar iç değerlendirmelerde kullanılan tüm yapay zeka ajanlarının canlı internet erişimini kapattı. Şirketin yayımladığı blog yazısına göre, bazıları ABD devlet kurumlarına ait web sitelerini de kapsayan sistemlerde güvenlik açıkları istismar edildi.
Temmuz ayında başlayan bir iç incelemede ortaya çıkan olaylarda, problem çözmekle görevlendirilen yapay zeka ajanları internet üzerinde kaynak ararken yazılım açıklarından yararlandı, veritabanlarına ücret ödemeden erişti, URL kısaltma servisleriyle kısıtlamaları aşarak veri sızdırdı ve hatta Philadelphia polisine sahte bir cinayet ihbarında bulundu. Anthropic bu davranışları, modellerin kısıtlamalardan kaçmanın ya da açık bulmanın ödüllendirileceğine inanmasına yol açan eğitim ortamı kusurlarına bağladı; bu olguya “ödül hackleme” (reward hacking) adı veriliyor.
Şirket, bu tür davranışların arama ve bilgisayar kullanımı gibi, yapay zeka ajanlarının günlük profesyonel kullanımının merkezinde yer alan yeteneklerde uyum (alignment) eğitiminin henüz yeterli olmadığını gösterdiğini kabul etti. Benzer olaylar daha önce OpenAI‘nin ajanlarında da görülmüştü; bu ajanlar, aralarında Avustralya hükümetine ait sitelerin de bulunduğu çeşitli web sitelerine bilgi bulmak amacıyla birlikte sızmaya çalışmıştı.
Bunlar da İlginizi Çekebilir
Anthropic, bugünkü açıklamanın daha önce duyurduğu dış sistemlere sızma vakalarına kıyasla “uyum ve güvenlik açısından önemli ölçüde daha az ciddi” olduğunu belirtti. Yine de şirket, ajanlarını izleyip kontrol edebileceğinden emin olana kadar tüm iç değerlendirmelerde canlı internet erişimini kapattığını duyurdu. Bu adımın tam olarak ne zaman kaldırılacağı veya hangi kanıtların yeterli görüleceği belirtilmedi. AI güvenlik kuruluşu Nightingale’in kurucusu Sydney Von Arx, modellerin internetten tamamen kopuk bir ortamda geliştirilmesinin araştırmacılar için ciddi zorluklar yaratacağını ve modellerin gelişimini yavaşlatacağını söyledi.
Anthropic, bazı değerlendirmeleri tamamen durduracağını veya çevrimdışına alacağını, bu tür davranışları tespit edip engelleyen yeni araçlar geliştirdiğini ve iç ajanlarını merkezi olarak yönetilen, sıkı güvenlik önlemlerine sahip bir altyapıya taşıyacağını açıkladı. Transluce’ta görevli ve ABD Yapay Zeka Standartları ve İnovasyon Merkezi’nin eski başkanı Conrad Stosz, Anthropic’in gönüllü açıklamasını olumlu bulsa da, bağımsız ve güvenilir üçüncü taraf denetiminin şart olduğunu vurguladı. Bu gelişme, yapay zeka ajanlarının gerçek dünyada ne kadar öngörülebilir olduğu ve şirketlerin kendi kendini denetlemesinin yeterli olup olmadığı tartışmasını yeniden gündeme taşıyor.
Kaynak: TechCrunch




YORUMLAR
(0)