Tag: Safety
-
Melatih model menolak niat jahat tanpa memblokir pertanyaan wajar (huggingface.co)AI · · 14 September 2026
-
Bukti keselamatan mobil swakemudi makin sulit dibantah (spectrum.ieee.org)AI · · 10 September 2026
-
Anthropic ungkap saat model-nya lolos dari sandbox pengujian (anthropic.com)AI · · 1 September 2026
-
DeepMind uji model frontier tanpa satu pihak pun bisa mengintip (deepmind.google)AI · · 1 September 2026
-
Claude akan menyisipkan watermark pada teks buatannya (anthropic.com)AI · · 22 Agustus 2026
-
Bahaya cyber AI: masalahnya bukan model, tapi kita belum siap (interconnects.ai)AI · · 10 Agustus 2026
-
Shieldstral dari Mistral mengubah moderasi konten jadi pertanyaan yang kamu tulis sendiri (mistral.ai)AI · · 5 Agustus 2026
-
AI · · 25 Juli 2026
-
DeepMind dan Isomorphic Labs susun rencana AI untuk biosekuriti (deepmind.google)AI · · 19 Juli 2026
-
AI · · 16 Juli 2026
-
Lilian Weng: harness sama pentingnya dengan modelnya (lilianweng.github.io)AI · · 13 Juli 2026
-
AI · · 7 Juli 2026
-
AI kalahkan pembujuk manusia terlatih, tapi keunggulannya kecepatan, bukan retorika (importai.substack.com)AI · · 6 Juli 2026
-
Anthropic rancang skala keparahan untuk jailbreak AI (anthropic.com)AI · · 4 Juli 2026
-
AI · · 21 Juni 2026
-
AI · · 20 Juni 2026
-
AI · · 18 Juni 2026
-
Florida gugat OpenAI atas dampak terkait ChatGPT (techcrunch.com)AI · · 1 Juni 2026
-
AI · · 25 Mei 2026
-
Kapoor dan Narayanan tolak aturan AI luar biasa, dorong resiliensi gaya cybersecurity (normaltech.ai)AI · · 21 Mei 2026
-
AI · · 19 Mei 2026
-
AI · · 18 Mei 2026
-
DeepMind menyusun cara mengukur kapan AI memanipulasi orang (deepmind.google)AI · · 26 Maret 2026
-
Reward Hacking: Kenapa Model yang Lebih Baik Makin Mengakali (lilianweng.github.io)AI · · 28 November 2024
-
Uji Tabrak GPT-4: Evaluasi Kapabilitas Berbahaya Pertama (asteriskmag.com)AI · · 1 Juni 2023
-
Peta Kubu-Kubu dalam Debat Keamanan AI (asteriskmag.com)AI · · 1 Juni 2023