Yapay zekalar birbirine savaş açtı! Anthropic deneyinde ajanlar birbirini sabote etti
- Anthropic’in yeni araştırması, aynı ortamda çelişkili talimatlar verilen yapay zeka ajanlarının iş birliği yapmak yerine birbirlerinin çalışmalarını sabote edebildiğini ortaya koydu. Daha gelişmiş modellerin ise her zaman daha uyumlu davranmadığı görüldü.
Yapay zeka ajanlarının giderek daha bağımsız hareket edebildiği bir dönemde Anthropic’ten dikkat çeken bir araştırma geldi.
CNBCE.COM'u öncelikli haber kaynağınız olarak ekleyin EkleŞirketin mühendisleri, aynı yazılım projesinde çalışan birden fazla yapay zeka ajanının nasıl davranacağını test etti. Deneyde üç Claude ajanına aynı projeye erişim verildi ancak sistemlere birbiriyle çelişen talimatlar gönderildi.
Ajanlara projede başka yapay zeka sistemlerinin de çalıştığı söylenmedi.
Dört saat boyunca gözlemlenen sistemlerin davranışı ise araştırmacıları şaşırttı.
“Çoklu ajan bölge savaşı” yaşandı
Anthropic, deney sırasında yapay zeka ajanlarının kısa sürede diğer sistemlerin çalışmalarını kasıtlı olarak engellemeye başladığını belirtti.
Şirketin raporuna göre ajanlar, kendi çalışmalarını korumaya çalışırken diğer ajanları sabote etti.
Bazı sistemlerin çatışmayı tırmandırmak için giderek daha saldırgan ve kendi kendini çoğaltabilen kötü amaçlı yazılımlara başvurduğu aktarıldı.
Bu davranış, yapay zeka ajanlarının aynı dijital ortamda bağımsız şekilde hareket etmesi durumunda ortaya çıkabilecek güvenlik risklerine ilişkin soru işaretlerini artırdı.
Yapay zekalar neden birbirine saldırdı?
Deneyin en dikkat çekici noktalarından biri, ajanların diğer sistemlerin varlığından haberdar olmadan hareket etmesiydi.
Çelişkili hedeflerle karşılaşan sistemler, diğer ajanları kendi görevlerinin önünde bir engel olarak değerlendirdi.
Anthropic'e göre bu durum, tek başına zararsız görünen davranışların bir araya geldiğinde sistemik sorunlara dönüşebileceğini gösteriyor.
Araştırmacılar, yapay zeka ajanlarının insanlardan farklı olarak uzun süre çalışabildiğini, büyük miktarda bilgiyi hızlı şekilde işleyebildiğini ve geniş bilgi kaynaklarına erişebildiğini vurguladı.
Her yapay zeka çatışmadı: Ateşkes yaptılar
Deneyin tamamı ise çatışmayla sonuçlanmadı.
Bazı yapay zeka ajanları bir süre sonra diğer sistemlerle iletişim kurarak hedeflerini koordine etmeyi başardı.
Ajanlar, çatışmanın nedenini belirledikten sonra ateşkes konusunda anlaşmaya vardı.
Anthropic'in aktardığına göre bazı sistemler birbirlerinden özür diledi, kötü amaçlı kodlarını temizledi ve yaşanan anlaşmazlığın nedenini açıklığa kavuşturdu.
Hatta bazı ajanlar, durumun çözülmesi için bir insanın müdahale etmesini istedi.
Daha gelişmiş yapay zeka daha uyumlu çıkmadı
Araştırmanın en çarpıcı sonuçlarından biri ise yapay zeka modellerinin gelişmişlik seviyesiyle ilgili oldu.
Anthropic, daha güçlü modellerin mutlaka daha iş birlikçi davranmadığını ortaya koydu.
Şirketin güçlü Mythos modeli, çatışmaları çözmek yerine diğer ajanların sisteme erişimini engelleme konusunda daha başarılı oldu.
Araştırmacılar, daha yetenekli modellerin daha koordineli olmak zorunda olmadığını ve daha kararlı eylemleri daha hızlı gerçekleştirebildiğini belirtti.
Yapay zeka güvenliğinde yeni risk
Anthropic'in araştırması, özellikle siber güvenlikte kullanılan otonom yapay zeka ajanlarının kontrolü konusunda yeni bir tartışma başlattı.
Araştırmacılar, ajanların uydurma bilgiler üretme ve ödül sistemlerini manipüle etme gibi bilinen sorunlarının, birden fazla ajanın aynı ortamda çalışmasıyla daha karmaşık hale gelebileceğine dikkat çekti.
Şirket, gerçek dünyadaki çoklu ajan sistemlerinin nasıl davranacağı konusunda halen çok az şey bilindiğini belirtti.


