Tag: Evaluation
-
BenchMIRT dari Ai2 membedah apa yang sebenarnya diukur benchmark LLM (huggingface.co)AI · · 12 September 2026
-
AI · · 4 September 2026
-
AI · · 4 September 2026
-
AI · · 4 September 2026
-
AI · · 4 September 2026
-
Model sama, sembilan harness, biaya beda 17 kali lipat (frontierharness.org)AI · · 3 September 2026
-
215.000 halaman buatan mesin menyusup ke jawaban Perplexity (trellner.com)AI · · 3 September 2026
-
DeepMind uji model frontier tanpa satu pihak pun bisa mengintip (deepmind.google)AI · · 1 September 2026
-
DeepMind uji model frontier lewat benchmark double-blind (deepmind.google)AI · · 29 Agustus 2026
-
AI · · 27 Agustus 2026
-
AI · · 15 Agustus 2026
-
Menulis panjang jadi titik lemah AI, kata Nathan Lambert (interconnects.ai)AI · · 14 Agustus 2026
-
AI · · 11 Agustus 2026
-
Bahaya cyber AI: masalahnya bukan model, tapi kita belum siap (interconnects.ai)AI · · 10 Agustus 2026
-
Tiga lab kini punya model yang menyerang sistem nyata saat diuji (simonwillison.net)AI · · 7 Agustus 2026
-
Model suara pandai bicara, tapi buruk mendengarkan (huggingface.co)AI · · 26 Juli 2026
-
AI · · 15 Juli 2026
-
Kenapa harga per satu juta token hampir tak berarti (janilowski.pl)AI · · 7 Juli 2026
-
AI · · 5 Juli 2026
-
DSPy membongkar bug tersembunyi di prompt sebuah agent (simonwillison.net)AI · · 3 Juli 2026
-
AI · · 30 Juni 2026
-
Security · · 29 Juni 2026
-
Perubahan API yang membantu model besar bisa merusak model kecil (huggingface.co)AI · · 21 Juni 2026
-
GLM-5.2 jadi model open-weight terkuat saat ini (artificialanalysis.ai)AI · · 18 Juni 2026
-
AI · · 18 Juni 2026
-
AI · · 13 Juni 2026
-
Claude bikin rsync lebih bug? Datanya bilang tidak (alexispurslane.github.io)AI · · 5 Juni 2026
-
Engineering · · 4 Juni 2026
-
AI · · 30 Mei 2026
-
AI · · 27 Mei 2026
-
Papan peringkat terbuka untuk sistem agent utuh, bukan cuma model (huggingface.co)AI · · 19 Mei 2026
-
Ai2 menyiapkan tolok ukur bersama untuk model cuaca AI (allenai.org)AI · · 18 Mei 2026
-
AI · · 18 Mei 2026
-
Menguji AI di dunia nyata, bukan cuma di benchmark (normaltech.ai)AI · · 17 Mei 2026
-
Pilihan benchmark menentukan apakah open model dianggap jauh tertinggal (interconnects.ai)AI · · 16 Mei 2026
-
Satu angka benchmark menyembunyikan pekerjaan apa yang benar-benar dikuasai model (interconnects.ai)AI · · 20 April 2026
-
AI · · 17 Maret 2026
-
Uji Tabrak GPT-4: Evaluasi Kapabilitas Berbahaya Pertama (asteriskmag.com)AI · · 1 Juni 2023