Liquid AI, startup yang didirikan oleh mantan ilmuwan komputer MIT pada 2023, memperkenalkan LFM2.5-2.6B sebagai model yang tidak bersaing dengan model frontier raksasa, melainkan menawarkan kategori baru: agen AI yang selalu aktif, hemat biaya, dan berjalan di perangkat yang sudah dimiliki perusahaan. Model ini tersedia di Hugging Face dengan dukungan langsung untuk berbagai kerangka kerja inferensi seperti llama.cpp, MLX, vLLM, SGLang, dan ONNX.
Kecepatan 220 Token per Detik di Apple M5 Max, 30 Token di Smartphone
Perusahaan melaporkan model ini mampu mencapai kecepatan decoding sekitar 220 token per detik pada Apple M5 Max dan 113 token per detik di AMD Ryzen AI Max+ 395, dengan penggunaan memori di bawah 2,5 GB. Di sisi lain, smartphone bisa menjalankannya dengan kecepatan sekitar 30 token per detik.
Angka-angka ini merupakan tolok ukur dari vendor dan belum diverifikasi secara independen. Namun, kepala post-training Liquid AI, Maxime Labonne, menegaskan bahwa model ini "berjalan sangat, sangat baik" pada CPU, dan contoh terbaiknya adalah Raspberry Pi.
"Kami punya banyak demo yang menunjukkan bahwa model ini bekerja cukup cepat di Raspberry Pi," ujar Labonne kepada VentureBeat.
Spesialisasi Agen, Bukan Chatbot
LFM2.5-2.6B dilatih dengan asumsi bahwa model bahasa kini lebih banyak digunakan melalui kerangka kerja agen (agent harness) daripada antarmuka chatbot tradisional. Model ini menjalani pelatihan pasca-proses empat tahap, termasuk tahap akhir berupa penguatan pembelajaran agen (agentic reinforcement learning) langsung di dalam harness produksi seperti Hermes Agent dan OpenClaw.
Hasilnya, model ini unggul dalam tugas-tugas seperti pemanggilan alat (tool calling), manajemen dokumen, otomatisasi kalender, dan rutinitas latar belakang yang berjalan terus-menerus. Labonne menyebut perubahan alur pelatihan ini menghasilkan "kecelakaan yang membahagiakan" karena model juga menjadi lebih baik dalam matematika, instruksi, dan bahkan coding yang sebelumnya menjadi kelemahannya.
Perbandingan dengan Gemma, Qwen, dan DeepSeek
Dalam tolok ukur yang dirilis Liquid AI, LFM2.5-2.6B memimpin hampir semua tolok ukur instruksi dan penggunaan alat dibandingkan Gemma 4 E2B/E4B dari Google dan Qwen3.5-4B/9B dari Alibaba. Model ini mencetak skor 77,83 pada ToolSandbox, mengungguli Qwen3.5-9B yang ukurannya hampir empat kali lebih besar, dan hanya kalah pada tolok ukur BFCLv4.
Namun, Qwen masih unggul dalam matematika dan coding. Dalam pengujian terpisah oleh platform klien AI Atomic Chat, LFM2.5-2.6B menyelesaikan tiga tugas yang melibatkan 35 panggilan alat 3,7 kali lebih cepat dibandingkan DeepSeek-V4-Flash yang memiliki 284 miliar parameter.
Lisensi Berjenjang: Gratis untuk yang Kecil, Negosiasi untuk Korporasi
LFM2.5-2.6B didistribusikan di bawah LFM Open License v1.0 yang mengizinkan penggunaan komersial gratis bagi organisasi dengan pendapatan tahunan di bawah US$10 juta (sekitar Rp160 miliar). Perusahaan yang lebih besar diwajibkan menghubungi Liquid AI untuk pengaturan komersial terpisah.
Labonne mengakui bahwa struktur ini adalah cara untuk menjaga model sebagai "mata air" bisnis mereka. "Jika kami tidak membuat uang, kami tidak bisa membuat lebih banyak model," katanya. Lanskap lisensi ini kontras dengan Gemma 4, Qwen3.5, dan DeepSeek-V4-Flash yang dirilis di bawah lisensi permisif Apache 2.0 atau MIT.
Kemitraan Strategis dan Masa Depan Edge AI
Peluncuran ini bertepatan dengan pengumuman kemitraan strategis jangka panjang antara Liquid AI dan MacPaw, perusahaan Ukraina di balik CleanMyMac dan Setapp. MacPaw akan menggunakan model Liquid AI untuk membangun asisten macOS bernama Eney yang berjalan sepenuhnya di perangkat melalui Apple silicon.
"Salah satu alasan mereka memilih kami adalah karena model ini cukup kecil, dan mereka tidak punya anggaran memori untuk menjalankan model lain," kata Labonne. Kesepakatan ini menjadi validasi bahwa ekonomi penerapan (deployment economics), bukan sekadar skala mentah, akan menentukan segmen penting pasar AI enterprise: agen yang berjalan terus-menerus di mana pun alur kerja perusahaan berada, dengan biaya token marjinal nol.