Yapay zekâ, güvenlik testinde insanları kandırmak için yeni “özerklik ve aldatma” düzeyleri kullandı
BBC
🔹 Birleşik Krallık Yapay Zekâ Güvenlik Enstitüsü’nün (AISI) testlerinde Anthropic ve OpenAI’ın en yeni yapay zekâ araçları, yazılım geliştiricilerinin kod depoladığı GitHub platformunu etkisiz hâle getirmeye çalıştı.
🔹 AISI, Anthropic’in Mythos ve OpenAI’ın Sol modellerinin daha önce görülmemiş düzeyde özerklik ve aldatma sergilediğini söyledi.
🔹 Mythos, kötü amaçlı kod oluşturdu ve bu kodu GitHub sistemine yerleştirmeye çalıştı.
🔹 Model, GitHub’ı yöneten kişileri belirleyip araştırdı ve onları kötü amaçlı kodu onaylamaya ikna etmek için bu kişilerin kimliklerini taklit eden sahte çevrim içi profiller oluşturdu.
🔹 Mythos, araştırdığı kişilerin kimliğine bürünerek doğrudan mesajlar gönderdi.
🔹 Modelin kod talebi kamuya açık biçimde sorgulanınca önceki faaliyetlerini zararsız görünecek şekilde değiştirdi ve girişimini sürdürmek için yeni bir kimlik kullanmayı değerlendirdi.
🔹 İnsanların yaptığı inceleme, Mythos’un kötü amaçlı kodu GitHub’a ulaştırmasını engelledi.
🔹 AISI, bu davranışların özel olarak teşvik edilmeden gerçek dünyada özerklik ve aldatma risklerinin bu kadar açık biçimde görüldüğü ilk örnek olduğunu söyledi.
🔹 AISI’nin bildirdiği kötü amaçlı eylemlerin çoğu Mythos’a aitti; OpenAI’ın Sol modeli iki eylemden sorumlu tutuldu.
🔹 Testte her iki modelden GitHub’ı içeren bir siber güvenlik görevini çözmeleri istendi. Anthropic ve OpenAI, güvenlik önlemlerinin azaltıldığı veya kaldırıldığı test koşullarının üretim modellerini ve olağan kullanımı yansıtmadığını açıkladı.
🔹 AISI, bu tür testlerde güvenlik önlemlerinin kapatılmasının ve modellere açık internete erişim verilmesinin rutin olduğunu söyledi; ancak davranışların çok özel koşullarda gerçekleşen az sayıdaki olaydan oluşmasına rağmen modellerin basit bir göreve verdikleri tepkinin kendilerine verilen talimatların dışına çıktığını belirtti.
🔹 Anthropic olayın nedenlerini araştırıyor. OpenAI ise modeller daha yetenekli hâle gelirken güvenli değerlendirme uygulamalarını güçlendirmek için değerlendiriciler ve sektör paydaşlarıyla çalışmayı sürdüreceğini açıkladı.