← semua berita

Bagaimana model dilatih berpikir lebih keras, atau lebih hemat

Engineering · · · sumber (magazine.sebastianraschka.com)

Tombol low, medium, high yang kini ada di model seperti GPT-5.6 terlihat seperti pengaturan prompt biasa, tapi Sebastian Raschka menjelaskan bahwa perilaku di baliknya dilatih sejak awal, bukan ditambahkan belakangan. Ia mengelompokkan metodenya jadi tiga keluarga. Yang paling sederhana menaruh level effort langsung di system prompt, jadi model membaca "Reasoning effort: high" dan sudah diajari apa artinya. Pendekatan kedua memakai supervised fine-tuning, mencampur contoh yang menampilkan seluruh jejak penalaran dengan contoh yang melewatinya, sehingga model menguasai kedua kebiasaan sebelum tahap reinforcement learning dimulai. Pendekatan ketiga membentuk perilaku saat reinforcement learning dengan mengenakan penalti per-token berbeda untuk tiap mode: penalti ringan membiarkan mode high berpikir panjang menuju jawaban benar, sedangkan penalti berat memaksa mode low tetap ringkas.

Angka-angkanya memperjelas kompromi ini. Metode toggle pada Kimi K2.5 memangkas token 25 sampai 30 persen tanpa menurunkan skor benchmark, penghematan langsung untuk biaya dan latensi. Inkling dari Thinking Machines menyediakan tuas kontinu dari 0,2 hingga 0,99, bukan tiga tingkat diskret, meski Raschka mencatat peningkatannya mendatar di ujung atas rentang itu. Nemotron 3 Ultra hanya mengalokasikan sekitar 2,5 persen prompt reinforcement learning-nya untuk mode medium, pengingat bahwa tiap mode butuh porsi pelatihan yang disengaja. Kesimpulannya, tidak ada satu resep yang menang, mayoritas tim menggabungkan fine-tuning untuk menanamkan perilaku dengan reinforcement learning untuk mengasahnya, dan langkah berikutnya kemungkinan model yang memilih sendiri tingkat effort-nya.

Kenapa ini penting

Kalau Anda membayar per token atau peduli pada latensi, tombol penalaran ini adalah tuas nyata, bukan gimik: model yang sama bisa lebih murah sepertiga untuk tugas ringan saat Anda turunkan. Uraian Raschka membantu Anda memahami kenapa mode low sebuah model bisa tetap lambat, dan apa yang perlu diuji sebelum mempercayai pengaturan itu pada tugas Anda sendiri.

ReasoningLLM Architecture