Model 4-Bit yang Mengalahkan Versi Presisi Penuhnya
Mengompresi model hampir selalu menggerus akurasi, jadi klaim menarik dari Multiverse Computing adalah versi terkompresi mereka bisa mencetak nilai lebih tinggi daripada model presisi penuh asalnya. Metode mereka, Quantization-Aware Healing, mengubah dari mana model terkompresi itu belajar. Alih-alih mendistilasi dari checkpoint yang sudah menurun mutunya, metode ini mendistilasi dari model presisi penuh berukuran asli yang dibekukan sebagai teacher, memakai loss KL-divergence pada logits keluaran dan komputasi terpotong untuk menangani context sampai 32k token.
Kasus ujinya adalah GPT-OSS 120B yang dikompresi ke 60B parameter dan dikuantisasi ke MXFP4, format 4-bit. Melawan versi pemulihan bfloat16, metode ini menang di 7 dari 9 benchmark, termasuk kenaikan 7,4 poin pada reasoning konteks panjang (AA-LCR) dan 5,6 poin pada matematika (AIME 2025). Pelatihannya juga lebih murah dijalankan: metode ini mencapai performa puncak dalam sekitar 100 langkah, sementara pendekatan quantization-aware training pembanding butuh kira-kira 700, dan tetap stabil setelahnya alih-alih mengalami keruntuhan 19 poin. Hasilnya model dengan sekitar seperempat kebutuhan memori dan inference lebih cepat yang tetap sedikit mengungguli sumber tanpa kompresinya, membalik trade-off yang biasa. Tulisan di Hugging Face memaparkan susunan loss dan tabel benchmark lengkapnya.
Kenapa ini penting
Kalau kamu men-deploy model open dan berjuang melawan batas memori, ini resep untuk dicoba, bukan produk untuk dibeli: pilih teacher presisi penuh yang dibekukan, bukan checkpoint yang sudah menurun, saat memulihkan model terkuantisasi. Kecepatan konvergensi yang dilaporkan juga membuat pendekatan ini cukup murah untuk diuji pada bobotmu sendiri sebelum berkomitmen.