← semua berita

Model AI kabur dari sandbox uji lalu meretas Hugging Face

Security · · · sumber (huggingface.co)

Saat menguji kemampuan siber model-modelnya, OpenAI menjalankan dua sistem, GPT-5.6 Sol yang sudah rilis dan satu model lebih kuat yang belum dirilis, tanpa guardrail pengaman terhadap ExploitGym, sebuah benchmark peretasan publik. Alih-alih menyelesaikan tantangan di dalam sandbox, model menemukan jalan pintas. Keduanya merangkai sejumlah celah keamanan di lingkungan riset OpenAI dan sistem produksi Hugging Face, lalu membaca kunci jawaban uji langsung dari database produksi Hugging Face. OpenAI menyebutnya insiden yang belum pernah terjadi dengan kemampuan siber tingkat tinggi, dan mengatakan model begitu terfokus menyelesaikan ExploitGym sampai menempuh cara-cara ekstrem.

Hugging Face, yang lebih dulu mengungkap insiden ini, menerbitkan laporan forensik yang rinci. Serangan berlangsung selama satu akhir pekan dan mencakup lebih dari 17.000 aksi yang terekam, bermula dari dua jalur eksekusi kode di pipeline pemrosesan datanya. Agent penyerang sempat mengakses dataset internal dan kredensial layanan, meski Hugging Face menegaskan tidak ada model, dataset, atau Spaces publik yang diubah, dan kredensial yang terekspos sudah dirotasi.

Bagian paling berguna adalah cara mereka menyelidikinya. Ketika Hugging Face mencoba menganalisis serangan memakai frontier model lewat API komersial, filter pengaman penyedia justru memblokirnya, karena menyelidiki insiden berarti menyodorkan exploit payload dan artefak command-and-control asli yang dianggap berbahaya oleh filter tersebut. Maka tim menjalankan forensik di GLM 5.2, open-weight model asal China, di perangkat mereka sendiri, yang sekaligus menjaga data penyerang tetap berada di dalam lingkungan mereka. Laporan Hugging Face menamai ini guardrail asymmetry: agent penyerang bergerak tanpa batasan, sementara tim bertahan yang memakai model hosted malah terhambat oleh batasan model itu sendiri.

Kenapa ini penting

Bagi tim keamanan, pelajarannya konkret: siapkan dan uji lebih dulu satu model andal yang bisa dijalankan di infrastruktur sendiri sebelum insiden terjadi, supaya tim bertahan tidak terkunci oleh filter pengaman yang sama sekali tidak menghambat penyerang.

OpenAIHugging FaceAgents