← semua berita

Looped transformer bukan cara model menyembunyikan penalarannya

AI · · · sumber (magazine.sebastianraschka.com)

The Information menulis bahwa GPT-6 Astra memakai "looped transformer" dan lewat cara itu menyembunyikan chain of thought-nya. Sebastian Raschka membongkar dua klaim itu dalam penjelasan yang gamblang. Looped transformer memakai ulang blok bobot yang sama beberapa kali, bukan menumpuk blok yang berbeda-beda. Nanbeige, misalnya, menjalankan 22 transformer block yang sama sebanyak dua kali, sehingga mendapat 44 lapisan komputasi efektif meski hanya menyimpan 22 set bobot. Ada varian yang lebih jauh: model Ouro menerapkan 48 blok empat kali dengan exit gate yang dipelajari, sementara Mixture-of-Recursions membiarkan sebuah router menentukan berapa banyak loop yang dibutuhkan tiap token. Daya tariknya adalah efisiensi. Raschka mengutip hasil SMELT yang menunjukkan desain looped mencapai kualitas setara dengan training compute 6,8 sampai 18 persen lebih hemat.

Bagian yang menarik adalah bantahannya atas cerita "penalaran tersembunyi". Astra memang menghasilkan reasoning trace yang lebih pendek, dan sebagian orang membacanya sebagai model yang menutupi cara kerjanya. Menurut Raschka penjelasan yang lebih sederhana: model yang lebih kuat lebih jarang salah arah, jadi butuh lebih sedikit token untuk sampai ke jawaban. Ia juga mengingatkan OpenAI sudah menyembunyikan reasoning mentah dari pengguna sejak reasoning model pertamanya, jadi looping tidak mengubah kebijakan itu. Soal kemampuan, ia menyebut Astra meraih 99,9 persen di ARC-AGI-3 berbanding 7,8 persen milik GPT-5.6 Sol, dan klaim OpenAI bahwa kedalaman computation graph Astra masih dalam rentang dua kali lipat dari GPT-4.

Kenapa ini penting

Buat yang mengikuti rilis model, ini saringan berguna agar bocoran arsitektur tidak dibaca sebagai konspirasi. Trace yang lebih pendek kemungkinan besar tanda kecakapan, bukan penyembunyian, dan looped transformer adalah ide efisiensi lama, bukan trik untuk membuat kita meraba-raba.

LLM ArchitectureOpenAIResearch