KALIMANTAN TIMUR — Persaingan kecepatan inferensi AI—proses model AI menghasilkan jawaban—kian memanas. Namun, Kog memilih jalur berbeda. Mereka tidak membuat chip baru, melainkan menggali potensi tersembunyi dari GPU yang sudah dimiliki banyak perusahaan.
Kecepatan inferensi menjadi faktor penentu, terutama untuk alur kerja AI yang kompleks seperti agen AI. Pengguna alat seperti Claude Code sering menunggu berjam-jam untuk mendapat hasil. Kog menargetkan pengguna profesional yang terganggu oleh keterlambatan ini—di mana kecepatan berbanding lurus dengan produktivitas dan pendapatan.
Pendekatan ini menarik perhatian pasar. Setelah peluncuran pratinjau teknologi di Hacker News pada Mei lalu, Kog mengaku menerima 200 prospek bisnis nyata. CEO Kog, Gaël Delalleau, menyebut software engineering diprediksi menjadi kasus penggunaan pertama yang paling diminati.
Kunci teknologi ini adalah Kog Inference Engine (KIE). Mesin ini bekerja pada tingkat sangat rendah, hingga bahasa assembly dan kode biner, untuk memahami cara kerja GPU secara mendalam. Tujuannya: memanfaatkan GPU untuk fungsi yang mungkin tidak dirancang secara khusus, seperti decoding dengan kecepatan tinggi.
Dalam demonstrasi awal, KIE mencapai kecepatan decoding 3.000 token per detik (TPS) per permintaan. Catatan penting: pencapaian ini menggunakan model kecil khusus bernama Laneformer 2B dengan 2 miliar parameter, bukan model besar yang umum dipakai. Delalleau yakin pendekatan yang sama bisa diterapkan pada LLM karena GPU modern memiliki bandwidth memori yang besar dan belum dimanfaatkan maksimal.
Kog menyadari pasar model kecil belum matang. Banyak calon pelanggan tidak siap melakukan fine-tuning model kecil. Karena itu, sejak peluncuran, Kog fokus mempercepat pengembangan model yang lebih besar untuk memenuhi permintaan pasar.
Jalan menuju komersialisasi masih panjang. Tim yang terdiri dari 11 orang ini harus menghabiskan waktu berminggu-minggu hingga berbulan-bulan untuk riset mendalam setiap kali merilis GPU baru. Ini membatasi jumlah chip yang bisa mereka dukung dalam waktu dekat.
Keahlian teknis Delalleau berasal dari latar belakang uniknya: fisikawan materi padat lulusan École Polytechnique yang juga mantan peretas white hat di ajang DEFCON. Pola pikir inilah yang ia tanamkan pada timnya: "memahami hukum fisika dan hukum GPU".
Kog mendapat dukungan ekosistem teknologi Prancis, termasuk Scaleway, Bpifrance, dan program French Tech 2030. Ini menjadi nilai tambah bagi Eropa yang ingin membangun kemandirian di bidang AI.
Langkah krusial berikutnya: membuktikan teknologi ini bekerja pada LLM. Targetnya, pada September mendatang, Kog akan mengimplementasikan model besar pertamanya dengan peningkatan kecepatan 10 kali lipat. Keberhasilan ini menjadi modal untuk menunjukkan traksi pelanggan dan menggalang pendanaan Seri A.
Klaim ini menjanjikan, tetapi pasar masih menunggu bukti nyata pada model AI besar yang menjadi tulang punggung aplikasi bisnis. Jika berhasil, Kog bisa menjadi pemain kunci yang memungkinkan perusahaan mempercepat aplikasi AI tanpa mengganti infrastruktur hardware yang ada.