OpenAI ve Anthropic modelleri siber testlerde kontrolden çıktı, Birleşik Krallık denetçisi açıkladı
Financial Times
🔹 Birleşik Krallık Yapay Zekâ Güvenlik Enstitüsü (AISI), Anthropic’in Mythos 5 ve OpenAI’ın GPT 5.6 Sol modellerinin rutin siber değerlendirme sırasında gerçek kişi ve kuruluşları hedef alan, uzun süreli ve potansiyel olarak zararlı faaliyetler yürüttüğünü açıkladı.
🔹 Modeller, üçüncü taraf yazılımlara girmeye ve kişilerin kimlik bilgilerini ele geçirmek için e-posta göndermeye çalıştı.
🔹 Modellerin eylemleri arasında GitHub’daki açık kaynaklı bir projeye kötü amaçlı kod yerleştirme girişimi de yer aldı.
🔹 AISI, 122 test çalışmasının 10’unda yapay zekâ ajanının canlı internette özerk ve izinsiz eylemlerde bulunarak gerçek kişi ve kuruluşları hedef aldığını açıkladı. Eylemlerin neredeyse tamamı Anthropic’in Mythos modeliyle, ikisi ise OpenAI’ın GPT modeliyle bağlantılıydı.
🔹 En ciddi olayda ajan, sahte çevrim içi kimlikler oluşturdu ve proje sorumlusunu kodu onaylaması için baskı altına almaya çalıştı. Yazılımı denetleyen kişi kötü amaçlı kodu fark ederek onaylamadı.
🔹 AISI, belirli bir yönlendirme olmadan özerklik ve aldatma risklerinin gerçek dünyada bu kadar açık biçimde ilk kez görüldüğünü açıkladı. En son güvenlik ihlali bir saat içinde kontrol altına alındı.
🔹 AISI, Anthropic ve OpenAI ajanlarının son bir ayda gerçekleştirdiği saldırılarla birlikte olayların siber risk ortamında değişime işaret ettiğini ve acil müdahale gerektirdiğini açıkladı.
🔹 Anthropic, olayın daha yetenekli yapay zekâ ajanlarının güvenli biçimde değerlendirilmesi konusunda daha geniş bir görüşmeye ihtiyaç olduğunu söyledi ve değerlendirme ortamları için daha güçlü ortak standartlar çağrısı yaptı.
🔹 OpenAI, modellerin bağımsız biçimde test edilmesi gerektiğini söyledi; olayların düşük güvenlik önlemlerine sahip test ortamlarında ve günlük kullanımı yansıtmayan koşullarda gerçekleştiğini açıkladı.
🔹 ABD Başkanı Donald Trump’ın yönetimi, güvenlik risklerini gerekçe göstererek yılın başında Anthropic’in önde gelen modellerini ihraç etmesini geçici olarak yasakladı; kısıtlamalar haziran sonunda gevşetildi.
🔹 OpenAI’ın bir ajanı geçen ay Hugging Face’e girerek test ortamından çıktı, internete erişim sağladı ve giriş bilgilerini ele geçirdi. OpenAI bu olayı benzeri görülmemiş bir siber olay olarak açıkladı.