OpenAI dan Cerebras genjot GPT-5.6 Sol ke 750 token per detik
OpenAI dan Cerebras menaruh GPT-5.6 Sol di tier layanan baru bernama Ultrafast, dan intinya adalah latensi. Model berjalan hingga 750 token per detik, yang oleh OpenAI disebut sekitar 14 kali kecepatan versi standar. Cerebras memberi konteks dengan angka yang sama: kira-kira 11 kali lebih cepat dari Fable 5 dan 5 kali lebih cepat dari Opus 4.8 di mode Fast. Buktinya paling terlihat pada satu uji benchmark. Di Humanity's Last Exam, kumpulan 2.500 soal sulit, Ultrafast rampung dalam 11 jam 11 menit, dibanding lebih dari 78 jam untuk konfigurasi pesaing. Pada rangkaian tugas ekonomi GDP-Val, Cerebras melaporkan percepatan 5,6x dari ujung ke ujung tanpa penurunan kualitas.
Kecepatan itu datang dari perangkat keras, bukan model yang diperkecil. Cerebras memakai Wafer-Scale Engine, satu chip dengan 44 GB SRAM on-chip, yang menahan bobot model tetap berada di chip alih-alih memindahkannya antar tingkat memori untuk setiap token. Cara itu menghapus perpindahan data yang biasanya menghambat inference. Perusahaan mengarahkannya ke pekerjaan yang mahal jika harus menunggu: penanganan insiden produksi, triase keamanan real-time, dan loop agent yang biasanya macet di antara langkah. Untuk saat ini statusnya preview terbatas, terbuka bagi pelanggan terpilih. Rinciannya ada di blog Cerebras.
Kenapa ini penting
Kalau kamu membangun agent, waktu respons kerap menentukan apakah sebuah loop layak dipakai, dan percepatan 5x sampai 14x mengubah apa yang bisa dijalankan secara interaktif, bukan sebagai proses batch. Ganjalannya ada di akses: masih preview dan terikat perangkat keras khusus, jadi rencanakan berdasarkan ketersediaan, bukan sekadar angka token per detik.