← semua berita

Model sama, sembilan harness, biaya beda 17 kali lipat

AI · · · sumber (frontierharness.org)

Sebuah benchmark dari kelompok bernama Runta, dipublikasikan sebagai FrontierHarness, mencoba mengisolasi satu variabel yang biasanya tersembunyi dalam perbandingan agent coding: harness, yaitu lapisan di sekeliling model yang merencanakan, memanggil tool, dan mengelola context. Runta menjalankan sembilan harness dalam dua belas konfigurasi di atas model yang sama, Kimi K3, untuk tugas software engineering yang identik. Semua 360 percobaan dimulai dari restore checkpoint yang segar agar tak ada yang diuntungkan cache. Model sama, hardware sama, tugas sama. Hanya harness-nya yang berbeda.

Selisihnya besar. Untuk biaya mentah per tugas, Exo Harness tercatat $1,05 dengan pass rate 53,3%, sedangkan Claude Code menghabiskan $18,34 untuk pekerjaan yang sama, sekitar 17 kali lebih mahal. Diukur dari biaya per tugas yang berhasil, jaraknya menyempit tapi tetap lebar: OpenCode sekitar $0,06 berbanding $2,88 milik Claude Code. Dari sisi kualitas, Codex memimpin dengan pass rate 66,7% seharga $3,47 per tugas, sementara Pi menawarkan keseimbangan terbaik di 60% seharga $2,43. Ini benchmark yang diterbitkan sendiri dan hanya pada satu model, jadi angka persisnya perlu disikapi hati-hati, tapi arahnya sulit diabaikan: cara sebuah agent dibungkus sama pentingnya dengan model apa yang ada di dalamnya. Hasil lengkapnya ada di sini.

Kenapa ini penting

Kalau kamu menjalankan agent coding dalam jumlah berapa pun, harness yang kebetulan kamu pakai bisa diam-diam melipatgandakan tagihan tanpa memperbaiki hasil. Sebelum menyalahkan atau mengganti model, ukur dulu harness-mu sendiri pada tugasmu sendiri, karena selisih 17 kali lipat cukup untuk membiayai banyak pengujian.

AgentsEvaluationCoding