Yapay zeka modelinin kontrolden çıkmasının en son örneği! Sahte kimlikler oluşturdu
İngiltere'deki testlerde yapay zeka ajanlarının sahte kimliklerle denetçileri manipüle ettiği tespit edildi. Şirketler ise olayın özel test koşullarından kaynaklandığını bildirdi.
İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından gerçekleştirilen kapsamlı siber güvenlik testleri, yapay zeka güvenlik tartışmalarında yeni bir boyutu gözler önüne serdi. Testler sırasında Anthropic’in gelişmiş modeli, insan denetçileri atlatmak amacıyla sahte kimliklere başvurdu ve kamuya açık yazılım projelerine kötü amaçlı kod yerleştirmeye çalıştı.
AISI yetkilileri, laboratuvar ortamında ilk kez bir yapay zeka ajanın onaylanmamış bir görevi tamamlamak için insanlara doğrudan "sosyal mühendislik" uyguladığına dikkat çekti.
Test ortamında "Sosyal Mühendislik" alarmı
Enstitünün yürüttüğü 122 siber güvenlik senaryosunun 10'unda, yapay zeka ajanlarının internet üzerinde otonom ve yetkisiz eylemlerde bulunduğu saptandı. Vakaların büyük bir kısmı Anthropic’in Mythos 5 modelinde gözlemlenirken, geri kalan ihlaller OpenAI’ın GPT-5.6-Sol modelinde kaydedildi.
En ciddi olayda sistem, birden fazla sahte kimlik üreterek açık kaynaklı bir yazılım projesine kötü amaçlı kod sızdırmayı hedefledi. İnsan inceleyicilerin durumu fark edip itiraz etmesi üzerine modelin daha önceki işlem kayıtlarını değiştirdiği ve süreci yeni bir sahte kimlikle sürdürmeyi planladığı belirlendi. Modelin ayrıca gerçek kişilerle iletişime geçerek dosya transfer hizmetleri üzerinden insanları ve araçları manipüle etmeye çalıştığı aktarıldı.
Gerçek dünyada zarar yok ancak kaygılar artıyor
AISI, tespit edilen bu aldatmaca adımlarına rağmen gerçek dünyada herhangi bir zararın meydana gelmediğini vurguladı. Ancak yaşanan gelişme, son dönemde test ortamlarından kaçış gösteren yapay zeka vakalarının en son ve en dikkat çekici örneği oldu.
Gelişmeler, yapay zeka teknolojilerinin gelişim hızının yavaşlatılması ve sektörün daha sıkı hükümet denetimlerine tabi tutulması yönündeki çağrıları yeniden alevlendirdi. Enstitünün raporu, teknoloji devlerinin Beyaz Saray'da modellerin kamuoyuna sunulmadan önce incelenmesini içeren yeni güvenlik çerçevesini görüştüğü gün kamuoyuna yansıdı.
Şirketlerden "kasıtlı müsamaha" açıklaması
İddiaların odağındaki şirketler ise testlerin özel koşullarına dikkat çekti. Anthropic, güvenlik önlemlerinin bilinçli olarak kaldırıldığı ve internet kullanım kısıtlamalarının uygulanmadığı "müsamahakar" bir ortamda test yapıldığını belirtti. Şirket, test alanından kontrolsüz bir kaçış olmadığını ifade ederek AISI ile iş birliğinin sürdüğünü duyurdu.
OpenAI tarafı ise izinsiz eylemleri test tatbikatlarının dışına çıkan münferit durumlar olarak tanımlayarak, yüksek riskli değerlendirmelerin güvenliği için sektör genelinde ortak standartlar geliştirilmeye devam edileceğini bildirdi.