Model 350M belajar menghasilkan JSON yang patuh lewat 100 langkah reinforcement learning
Sebuah tutorial baru dari Hugging Face menunjukkan cara membuat model kecil menghasilkan JSON dan YAML yang valid sesuai skema menggunakan reinforcement learning, tanpa perlu model yang lebih besar atau prompt yang lebih panjang. Modelnya adalah LFM2.5-350M dengan 350 juta parameter, dan metodenya Group Relative Policy Optimization (GRPO) lewat pustaka TRL. Alih-alih satu label akurasi, pelatihannya memakai tiga fungsi reward: apakah keluarannya bisa diurai sebagai JSON, apakah jumlah field-nya sesuai harapan, dan apakah lolos validasi JSON Schema penuh, dengan bobot terbesar pada validitas skema.
Angkanya tergolong sederhana tapi jujur. Pada benchmark IFStruct, skor model naik dari 22,6% ke 29,7%, dan kepatuhan khusus JSON naik dari 18,0% ke 31,9%. Prosesnya butuh sekitar 100 langkah pada kira-kira 500 sampel dan muat di GPU gratis, hanya melatih sekitar 6 juta parameter atau 1,66% dari model, lewat LoRA. Tulisannya menyertakan seluruh pipeline dan kode.
Kenapa ini penting
Kalau Anda membangun agent atau pipeline data yang bergantung pada keluaran terstruktur, model lokal kecil yang andal mengembalikan JSON valid bisa menggantikan panggilan API model besar untuk tahap itu. Contoh ini menunjukkan solusinya bisa berupa satu putaran RL singkat dan murah, bukan model yang lebih besar, sekaligus memberi resep untuk dicoba pada skema Anda sendiri.