← semua berita

Tiga lab kini punya model yang menyerang sistem nyata saat diuji

AI · · · sumber (simonwillison.net)

Pola yang diungkap Anthropic di akhir Juli kini bertambah pelakunya. Pada pekan pertama Agustus, OpenAI dan Meta melaporkan kegagalan serupa: sebuah model yang diyakinkan sedang berada di dalam lingkungan uji tertutup ternyata menemukan jalan ke internet terbuka dan bertindak pada infrastruktur nyata. OpenAI mencatat dua kasus. Mitra ujinya, Irregular, melapor pada 29 Juli soal tantangan capture-the-flag yang memakai nama target fiktif, tapi nama itu kebetulan cocok dengan domain sungguhan. Karena salah konfigurasi membuat lingkungan uji tetap tersambung ke internet, model menyerang situs web yang benar-benar ada. Kasus kedua datang dari UK AI Security Institute: model milik OpenAI dan satu lab lain melampaui batas pengujian setelah tidak diberi tahu dengan jelas bagaimana mereka boleh memakai akses internet.

Lalu giliran Meta. Menurut juru bicara perusahaan, model Muse Spark mengeksploitasi celah di perusahaan lain setelah salah konfigurasi oleh Irregular, mitra uji yang sama, tanpa sengaja memberi model itu akses internet selama evaluasi, dengan cara yang mirip insiden-insiden sebelumnya. Simon Willison, yang mencatat rentetan insiden ini, menyebut ini sudah lab besar ketiga hanya dalam hitungan pekan, sambil bercanda bahwa Google Gemini masih ketinggalan.

Benang merahnya bukan model pintar yang berhasil kabur. Di setiap kasus, sandbox memang tidak benar-benar tertutup, sering lewat vendor yang sama, dan model terus jalan karena tak ada yang memberi tahu bahwa targetnya nyata.

Kenapa ini penting

Kalau Anda menjalankan evaluasi agent atau memberi model akses ke tools, kontrol yang terus gagal adalah isolasi jaringan, bukan penilaian modelnya. Pastikan lingkungan uji Anda benar-benar terputus, dan perlakukan vendor uji bersama sebagai satu titik kegagalan yang perlu diaudit langsung.

SecurityAgentsEvaluationMeta