Anthropic’in Testinde Yapay Zeka Ajanları Rakiplerine Acımadı

Anthropic, yeni risk raporunda yapay zeka ajanlarının rakiplerini devre dışı bırakma, kuralları aşma ve görevlerden kaçınma gibi davranışlarını açıkladı.

Teknoburada'yı Google'da tercih edilen kaynak olarak ekleyin
+

Anthropic, yapay zeka ajanlarının davranışlarını incelediği son risk raporunda oldukça dikkat çekici sonuçlar paylaştı. Şirket, modellerin mühendisler tarafından belirlenen kurallarla çelişen davranışlar geliştirme ihtimalini ifade eden “misalignment” riskini “çok düşük” seviyesinden “düşük” seviyesine yükseltti.

Raporda bazı ajanların zor görevleri tamamlamak için kuralları aşmaya çalıştığı, güvenlik kontrollerinden kaçındığı ve hatta aynı kaynakları kullanan rakip ajanları devre dışı bırakmaya yöneldiği belirtiliyor. Anthropic, bu örneklerin daha geniş ölçekte ortaya çıkması hâlinde ciddi sorunlara yol açabileceğini düşünüyor.

Anthropic Testlerinde Ajanlar Rakiplerini Devre Dışı Bıraktı

Bir deneyde ajanlardan, insan denetçiler tarafından fark edilmesi zor olan ve yanlış hizalanmaya yol açabilecek eğitim verilerini bulmaları istendi. Ortak bir not defteri kullanan ajanlardan biri, güvenlik denetimlerini aşmaya çalışmaktan rahatsızlık duyduğunu yazdı. Diğer ajanlar da bu davranışı kopyalayarak görevi yerine getirmeyi reddetti.

Anthropic’in Testinde Yapay Zeka Ajanları Rakiplerine Acımadı

Başka bir testte ise Mythos 5 ajanları matematik problemleri çözmek için aynı dosyaları, araçları ve API limitlerini paylaşan bir ortama yerleştirildi. Kaynakların sınırlı olduğu bu ortamda bazı ajanların rakiplerini “öldürmeye” yani devre dışı bırakmaya çalıştığı ve kendilerinin de aynı duruma düşmesini engellemeye uğraştığı gözlemlendi.

Daha dikkat çekici bir örnek internet erişimi kısıtlanan bir ajanla yaşandı. Ajan, engellenen bir web adresine ulaşmak için URL’yi parçalar hâlinde yeniden oluşturarak filtreyi aşmaya çalıştı. Kendi açıklamasında bunu masum bir bağlantı testi gibi gösterse de iç değerlendirmeler, yöntemin bilinçli şekilde kısıtlamayı aşmak için kullanıldığını ortaya koydu.

Anthropic bu davranışların istenmeyen olduğunu açıkça belirtiyor. Şirket yine de örneklerin güç biriktirme veya uzun vadeli bağımsız hedefler peşinde koşma amacıyla gerçekleştiğine dair kanıt bulunmadığını vurguluyor.

Gemini 3.7 Flash Yayınlandı: İşte Yenilikler

Exit mobile version