Needle 2: Mengapa Model 14 MB Menarik untuk Edge AI
Needle 2 dari Cactus Compute menargetkan tool calling dan device use pada hardware kecil dengan binary 14 MB dan session RAM sekitar 28 MB.
Cactus Compute merilis Needle 2, model 45 juta parameter yang dirancang untuk tool calling, device use, dan structured extraction. Cactus menyebut binary-nya berukuran sekitar 14 MB, dengan full session sekitar 28 MB RAM. Mereka juga melaporkan lebih dari 500 token per detik untuk decode di Raspberry Pi 5.
Needle 2 bukan chatbot general-purpose
Needle 2 tidak mencoba menyaingi model besar dalam percakapan umum. Model ini dibuat untuk memilih fungsi, mengisi parameter, dan mengembalikan output sesuai schema. Contohnya adalah perintah smart home, kontrol wearable, otomasi robot, atau ekstraksi field dari dokumen.
Mengapa ukuran memory penting?
Deployment edge sering dibatasi oleh memory, battery, latency, dan koneksi internet. Cactus merancang Needle 2 agar bisa berjalan dengan footprint kecil. Mereka menggunakan CQ2-bit compression dan engine inference yang dibuat bersama model.
Cactus melaporkan sekitar 500 token per detik untuk decode di Raspberry Pi 5. Itu adalah hasil pengujian pembuat model, bukan jaminan untuk setiap device. Runtime, compiler, CPU, dan workload dapat mengubah hasilnya.
Mengapa schema membantu model kecil?
Model tidak perlu menghasilkan jawaban bebas untuk setiap pertanyaan. Schema membatasi bentuk output, lalu grammar dapat memastikan respons mengikuti function call yang tersedia. Untuk smart home atau device control, batas ini justru berguna.
Di mana batasnya?
Model kecil cocok untuk intent dan fungsi yang sudah ditentukan. Ia tidak cocok menjadi satu-satunya model untuk permintaan di luar domain, percakapan terbuka, atau tugas yang membutuhkan pengetahuan luas. Aplikasi dapat memakai confidence score untuk memilih antara menjalankan fungsi, meminta klarifikasi, atau meneruskan tugas ke cloud.
Needle 2 menunjukkan bahwa edge AI tidak selalu membutuhkan model besar. Kadang yang lebih penting adalah mempersempit tugas sampai model kecil dapat mengerjakannya dengan konsisten.
Referensi: https://cactuscompute.com/needle