← semua berita

Model coding kecil Poolside, Laguna S 2.1, ungguli rival yang jauh lebih besar

AI · · · sumber (poolside.ai)

Poolside merilis Laguna S 2.1, open-weight model untuk coding dengan 118 miliar parameter total tapi hanya 8 miliar aktif per token, dan klaim menariknya soal efisiensi. Di Terminal-Bench 2.1, uji agent yang bekerja di terminal sungguhan, model ini meraih 70,2%, yang menurut Poolside mengungguli DeepSeek-V4-Pro Max di 64% padahal model itu memikul 1,6 triliun parameter, sekitar empat belas kali lebih besar. Laguna S 2.1 juga mencatat 78,5% di SWE-Bench Multilingual dan 59,4% di SWE-Bench Pro, serta menampung context hingga 1 juta token. Seluruh model dilatih dalam waktu kurang dari sembilan minggu.

Poolside terus terang soal apa yang mereka ubah. Timnya menulis bahwa mereka tidak berupaya menambah kecerdasan mentah, melainkan memperbaiki perilaku model: lebih banyak verifikasi, tidak gampang menganggap benar, tidak buru-buru merasa selesai, dan lebih gigih pada tugas panjang. Hal itu terlihat juga di angka benchmark. Mengaktifkan thinking mode menaikkan skor Terminal-Bench dari 60,4% ke 70,2%, jadi sebagian besar peningkatan datang dari model yang memeriksa hasil kerjanya sendiri, bukan dari ukuran. Sebagai demonstrasi, Poolside menyebut model ini menurunkan ulang sebuah bukti untuk Erdős problem #397, dan pada percobaan terpisah membangun mesin browser HTML dan CSS di JavaScript dalam 50 menit lewat 181 langkah.

Bobot model terbuka di bawah lisensi OpenMDW-1.1, dan akses hosted dihargai sekitar $0,10 per juta token input dan $0,20 per juta token output di endpoint berbayar, dengan tier gratis berkonteks 256K. Uraian Poolside bisa dibaca di sini.

Kenapa ini penting

Kalau kamu membangun coding agent, model terbuka berukuran kecil yang menyamai model jauh lebih besar pada tugas terminal dan hanya berbiaya beberapa sen per juta token layak diuji pada repo-mu sendiri, karena menjalankannya di perangkat sendiri jadi realistis pada ukuran itu.

Open ModelsCodingAgents