← semua berita

Menjalankan model 2,8 triliun parameter di laptop dengan streaming dari SSD

AI · · · sumber (github.com)

Sebuah proyek bernama Deltafin menjalankan model Kimi K3 penuh dan tanpa kompresi, 2,8 triliun parameter, di satu MacBook. Kuncinya, ia tidak berusaha memuat seluruh model ke memori. Kimi K3 adalah model mixture-of-experts, jadi hanya beberapa expert yang aktif untuk tiap token, dan Deltafin melakukan streaming bobot expert itu sesuai kebutuhan dari empat SSD, membagi pembacaan ke seluruh drive agar I/O disk berjalan paralel. Inti model yang menetap di memori dikuantisasi ke int8, sementara expert tetap di BF16, sehingga tekanan memori berkurang tanpa menyentuh bagian yang menyimpan sebagian besar kualitas model.

Hasil pengukuran di M5 Max dengan RAM 128GB adalah sekitar 1,0 sampai 1,1 token per detik dengan speculative decoding aktif, di mana model draft kecil mengusulkan token yang lalu diperiksa oleh K3. Throughput naik seiring jumlah drive: satu SSD memberi kira-kira setengah kecepatan empat SSD, tiga SSD mencapai sekitar 90 persen. Catatan jujurnya ada di repositori: prefill memakan waktu sekitar 375 detik untuk prompt 512 token, unduhan penuhnya 1,7TB, dan ini demo riset, bukan produk. Setiap angka yang dilaporkan adalah satu cold run dengan prompt yang disebutkan.

Kenapa ini penting

Ini tidak akan menggantikan API untuk pemakaian interaktif, tetapi menunjukkan bahwa batas inference lokal ada pada bandwidth penyimpanan, bukan ukuran model. Kalau kamu peduli menjalankan open model berskala frontier secara privat, jalannya sekarang adalah SSD cepat dan streaming yang cerdas, bukan menunggu RAM cukup besar untuk menampung semuanya.

InferenceLocal LLMOpen Models