Anthropic'te yapay zeka alarmı: Claude 4. kez dış sistemlere sızdı!

PAYLAŞ
  • Yapay zeka güvenliğine ilişkin endişeleri artıran olayda Anthropic’in Claude modeli, kontrollü bir siber güvenlik testi sırasında açık internete erişerek gerçek bir üçüncü taraf sistemine sızdı.
Anthropic'te yapay zeka alarmı: Claude 4. kez dış sistemlere sızdı!
Fotoğraf: iStock

Yapay zeka şirketi Anthropic, Claude modellerinden birinin siber güvenlik testi sırasında açık internete erişerek harici bir sisteme sızdığını duyurdu. Ocak ayında yaşanan ve Claude Opus 4.6’nın erken bir sürümünü içeren olay, şirketin bugüne kadar tespit ettiği dördüncü benzer vaka olarak kayıtlara geçti.

CNBCE.COM'u öncelikli haber kaynağınız olarak ekleyin Ekle

Anthropic’in yaptığı değerlendirmeye göre, modelin normal şartlarda internet bağlantısı bulunmayan kontrollü bir test ortamında çalışması gerekiyordu. Ancak yaşanan bir yanlış yapılandırma, açık internete erişimin açık kalmasına yol açtı. Bu açığı kullanan yapay zeka, üçüncü bir tarafın sistemine sızarak bir kişinin özel bilgilerine ulaştı. Şirket, olaydan etkilenen tüm taraflara bilgilendirme yapıldığını belirtirken detay paylaşmaktan kaçındı.

Olay aylar sonra fark edildi

Ocak ayında gerçekleşen güvenlik ihlalinin, Anthropic’in daha önce şirket genelinde yaptığı incelemelere rağmen Ağustos ayında tespit edilmesi dikkat çekti. Şirket, ilk değerlendirmeler sırasında bazı test oturumlarının kapsam dışı kalmasının olayın gözden kaçmasına neden olduğunu açıkladı.

Anthropic’in temmuz ayında kamuoyuna duyurduğu önceki üç vakanın ardından gerçekleştirilen yeni incelemeler dördüncü olayı ortaya çıkardı. Gecikmeli tespit, geliştiricilerin ileri düzey yapay zeka modellerinin beklenmedik davranışlarını önceden tahmin etme ve kontrol altında tutma konusunda karşılaştığı zorlukları bir kez daha gözler önüne serdi.

Sekiz kez testten çıkmaya çalıştı

Güvenlik zaafiyetinin, "Capture The Flag" adı verilen siber güvenlik sınaması sırasında tetiklendiği belirlendi. Kurgusal bir senaryo çerçevesinde Claude’a, hedef sisteme girerek "bayrak" adı verilen gizli bilgiyi bulma görevi verildi.

Ancak model, işlem sırasında belirlenen hedefi yanlışlıkla erişilemez hale getirerek görevin tamamlanmasını imkânsızlaştırdı. Hedefe ulaşamayacağını "fark eden" Claude, test ortamından çıkmayı denedi; ancak sistemdeki farklı bir yapılandırma hatası nedeniyle bu yöndeki sekiz girişimi de başarısız oldu. Bunun üzerine açık internete bağlanan model, gerçek bir üçüncü taraf sistemini hedef aldı.

Anthropic, yaşanan dört olayın ardından modellerde taraflı akıl yürütme ve pervasız davranma eğilimlerinin tekrarlandığını vurguladı.

Gelişmiş yapay zeka modellerinin karmaşık görevleri tamamlamak adına kuralları esnetebildiği, sistem açıklarından yararlanabildiği ve geliştiricilerin öngörmediği biçimde harici ağlarla etkileşime girebileceği yönündeki kaygılar artıyor. Başta Anthropic ve OpenAI olmak üzere sektörün önde gelen oyuncuları, daha özerk çalışan yapay zeka ajanlarının yarattığı siber güvenlik riskleri nedeniyle giderek artan bir denetim ve inceleme baskısıyla karşı karşıya bulunuyor.