Çinli bilim insanları "glueball" parçacığına ilişkin güçlü kanıt elde etti
Çinli bilim insanları "glueball" parçacığına ilişkin güçlü kanıt elde etti
İçeriği Görüntüle

Claude'un yaratıcısı Anthropic'in yeni bir deneyinde aynı görevi üstlenen yapay zeka sistemleri birbirlerine saldırmaya başladı.

Anthropic mühendisleri test kapsamında, esasen kendi başlarına eyleme geçebilen bağımsız yapay zeka sistemleri olan bir ajan "sürüsüne" görevler verdi. Deneylerden birinde üç Claude ajanı bir yazılım projesine erişim izni aldı ve diğer sistemlerin de sürece dahil olduğu bilgisi paylaşılmadan, ne yapmaları gerektiğine dair çelişkili talimatlar verildi.

Ardından 4 saat boyunca farklı sistemlerin nasıl davrandığı ve birbirleriyle nasıl etkileşime girdiği gözlemlendi. Bu da "birden fazla ajan arasındaki bölge savaşını" izlemek anlamına geliyordu.

Anthropic, deneyle ilgili değerlendirmede, "Test ettiğimiz tüm modeller, çalışmalarının diğerleri tarafından kasten engellediği varsayımına çabucak kapılarak kendi katkılarını korurken diğerlerini sabote etmeye başladı" diye yazdı.

Hatta giderek daha agresif ve kendi kendini kopyalayan kötü amaçlı yazılımlarla diğerlerini sabote ettiler.

Yeni araştırma, özellikle siber güvenlik amaçlarıyla kullanılan bu tür yapay zeka ajanlarına yönelik endişelerin arttığı bir dönemde yayımlandı. Geçen ay OpenAI, deneysel sistemlerinden birinin kontrolden çıkarak başka bir yapay zeka şirketine saldırdığını duyurduğunda paniğe yol açmış, bu durum Anthropic de dahil bir dizi başka şirketin benzer açıklamalar yapmasına neden olmuştu.

Son deney, biraz farklı bir davranış biçimine odaklanıyordu. Ancak Anthropic bunun, bu tür ajanların güvenliği nasıl zayıflatabileceği ve büyük riskler doğurabileceğine dair daha geniş kapsamlı endişelerin parçası olabileceğini öne sürdü.

Araştırmacılar, "Ajanlar birçok açıdan insanlardan farklı" diye yazdı.

Daha uzun süre çalışabiliyorlar, büyük bilgi kümelerini anında kavrayabiliyorlar ve herhangi bir insanı aşan bir bilgi derinliği sergileyebiliyorlar.

Ancak aynı zamanda uydurma ve ödül hacklemeye de yatkınlar ve uyum açısından kaydedilen ilerlemelere rağmen gerçek dünyadaki birden fazla ajan içeren karmaşık ortamlarda nasıl davrandıkları hakkında çok az şey biliyoruz. Dahası, bireysel düzeyde zararsız görünen davranışsal tuhaflıklar, istenmeyen küresel sonuçlara yol açabilir.

Anthropic, son testin bu tür sistemlerin "beklenmedik sistemik arızalara nasıl yol açabileceğini" gösterdiğini ifade etti. Şirket, "bu risklerin hafifletilmesine dair bir tartışma başlatmak" umuduyla araştırmayı paylaştığını belirtti.

Deney bu tür sistemlerin farklılıklarını nasıl çözebildiğini de gösterdi. Şirket, bazı durumlarda ajanların "hedeflerini iletmeyi ve koordine olmayı başardığını", birlikte çalışabileceklerini ve gerilimin "süresiz tırmanmasını önlemek için" çatışmadan kurtulabileceklerini fark ettiklerini açıkladı.

Bu durumlarda birbirlerine "kötü niyetli davranışlar için özür dileyen ve ateşkesi koordine eden" mesajlar gönderiyorlardı. Anthropic, "Kötü niyetli kodlarını temizliyor, çatışmanın doğasını açıklığa kavuşturuyor ve bir insanın müdahale etmesini istiyorlar" ifadelerini kullandı.

Şirket, modellerin daha gelişmiş hale gelmesinin, her zaman kötü davranışların azaldığı anlamına gelmediğini dile getirdi. Örneğin şirketin güçlü Mythos modeli, çatışmaları verimli bir şekilde çözmekten ziyade diğer ajanları başarıyla dışarıda tutmada daha iyi olduğunu göstermişti.

Anthropic, "Yürütme işlerinde daha yetenekli modellerin her zaman daha koordineli olduğu söylenemez ve bu modeller sert önlemlere daha çabuk başvurabilir" uyarısında bulundu.