← semua berita

OpenAI pangkas harga GPT-5.6 Luna 80% setelah model menulis ulang kode inferensinya sendiri

AI · · · sumber (openai.com)

OpenAI memangkas harga GPT-5.6 Luna sebesar 80 persen, menjadi 0,20 dolar per juta token input dan 1,20 dolar per juta token output, serta menurunkan tier Terra yang lebih besar sebanyak 20 persen. Diskonnya bukan bagian yang menarik. Yang menarik adalah bagaimana mereka mencapainya. OpenAI menyebut model lain di keluarga yang sama, GPT-5.6 Sol, menulis ulang kernel inferensi produksinya sendiri memakai Codex, langsung di bahasa GPU Triton dan Gluon. Sol mencari pekerjaan yang bisa dihitung lebih awal, dilewati, atau dijalankan paralel, lalu menekan perpindahan memori dan jeda sinkronisasi. Semuanya memangkas sekitar 20 persen biaya melayani model dari ujung ke ujung, dan OpenAI meneruskan penghematan itu ke harga.

Dengan tarif baru, Luna kira-kira lima kali lebih murah di sisi input dibanding Claude Haiku 4.5 milik Anthropic dan lebih murah dari Gemini 3.1 Flash-Lite milik Google, seperti dicatat Simon Willison dalam ulasannya. Mekanismenya yang layak diperhatikan: model diberi tugas membuat dirinya sendiri lebih murah dijalankan, dan hasilnya mendarat di tagihan, bukan di makalah riset. Optimasi kernel justru jenis tugas yang sempit, terdefinisi jelas, dan mudah diuji, tempat sebuah agent bisa bekerja tekun tanpa banyak ruang untuk melenceng.

Kenapa ini penting

Kalau kamu menjalankan beban kerja bervolume tinggi di tier model murah, harga baru Luna mengubah apa yang sanggup kamu kirim ke API alih-alih ke model lokal. Ada baiknya menghitung ulang biaya penyedia yang kamu pakai sekarang terhadap tarif ini sebelum siklus tagihan berikutnya.

OpenAIInferencePricing