Granite 4.2 IBM Bawa Reasoning dan Latihan Agentic ke Model Open Kecil
Granite 4.2 adalah keluarga model open kecil pertama dari IBM yang dibangun di sekitar reasoning eksplisit, dirilis di ukuran 3B, 8B, dan 30B dengan lisensi Apache 2.0. Tiap model bisa berpindah antara mode thinking yang menghasilkan chain-of-thought dan mode non-thinking yang lebih cepat, jadi pemanggil hanya membayar reasoning langkah demi langkah saat tugas memang membutuhkannya. Arsitekturnya lazim untuk kelas ini: transformer decoder-only dengan grouped query attention, rotary position embeddings, dan lapisan feed-forward SwiGLU, diperpanjang hingga context 512K token.
Bagian yang lebih menarik adalah pipeline pelatihan yang dijabarkan IBM secara rinci. Pre-training berjalan lima fase di atas sekitar 15 triliun token dengan penyaringan kualitas bertahap, disusul supervised fine-tuning pada 7,2 juta sampel yang mencampur data instruksi agentic dan non-agentic. Setelah itu ada kurikulum reinforcement learning bertahap: RL dasar pada tugas yang bisa diverifikasi lebih dulu, lalu agentic RL untuk model 8B dan 30B pada software engineering nyata, perintah terminal, dan web search, ditutup dengan penyelarasan RLHF. Melatih model untuk bertindak di lingkungan nyata alih-alih simulasi itulah yang menurut IBM mendorong hasil coding-nya, dengan varian 8B dan 30B meraih 47,67 dan 57,00 persen di SWE-Bench. Ketiga ukuran mendukung tool calling native yang kompatibel dengan framework agentic standar.
Kenapa ini penting
Kalau kamu membangun agent di atas bobot open dan tidak bisa menjalankan model frontier di hardware sendiri, model 30B yang meraih 57 persen di SWE-Bench dengan lisensi permisif adalah opsi praktis untuk diuji. Resep RL yang terdokumentasi juga memberi tim template konkret untuk menambahkan perilaku agentic ke model kecil mereka sendiri.