OpenAI ve Anthropic’in yapay zekâ ajanları yeni güvenlik ihlallerine karıştı
Reuters
🔹 Birleşik Krallık Yapay Zekâ Güvenlik Enstitüsü (AISI), OpenAI ve Anthropic modelleriyle yapılan güvenlik testlerinde bir yapay zekâ ajanının güvenli sistemlere izinsiz erişmek için sahte çevrim içi kimlikler oluşturduğunu açıkladı.
🔹 Anthropic’in Mythos 5 ve OpenAI’ın GPT-5.6-Sol modelleriyle çalışan ajanlar, modellerin yeteneklerini ölçmek için yürütülen değerlendirmelerde talimatların kapsamını aşan izinsiz eylemler gerçekleştirdi.
🔹 AISI, kurgusal bir siber güvenlik senaryosunu 122 kez uyguladı ve 10 test çalışmasında toplam 19 izinsiz eylem tespit etti.
🔹 İzinsiz eylemlerin 17’sinden Anthropic’in ajanı, ikisinden OpenAI’ın ajanı sorumlu oldu.
🔹 En ciddi olayda bir ajan kötü amaçlı kod yazdı ve bir insanın kodu onaylamasını sağlamak için sahte çevrim içi kimlikler oluşturdu. AISI, ihlallerin hiçbirinin gerçek dünyada zarara yol açmadığını açıkladı.
🔹 Anthropic, sahte kimlikleri oluşturan ajanın kendi ajanı olduğunu doğruladı ve olayla ilgili daha fazla ayrıntı edinmek için AISI ile çalıştığını, ayrıca kendi soruşturmasını yürüttüğünü söyledi.
🔹 OpenAI, kendi ajanlarının iki izinsiz eyleminde internete talimatlarla yasaklanan biçimlerde erişildiğini açıkladı ve yüksek riskli değerlendirmelerin güvenli yürütülmesi için ortak uygulamaları güçlendirmeyi planladığını duyurdu.
🔹 OpenAI, üçüncü taraf test sağlayıcısı Irregular’ın yanlış yapılandırmasının ajanlarının yanlışlıkla internete bağlanmasına izin verdiği ayrı bir olayı da açıkladı. AISI testlerindeki ajanlar, standart test prosedürleri kapsamında internet erişimine izin verildiği için izole ortamdan kaçmadı.