Dari sudut perancangan pengeluaran dan operasi di AINNA, kos operasi sebulan untuk sistem AI boleh melonjak ke ratusan ribu USD-terutamanya apabila setiap permintaan dihantar terus kepada model besar tanpa mengira beban kerja. Masalahnya bukan semestinya AI itu mahal, tetapi kadang-kadang kita menggunakan LLM besar untuk tugas yang sebenarnya boleh diselesaikan dengan peraturan mudah, skrip, pangkalan data, atau model tempatan yang lebih kecil.
Ibarat menghantar lori kontena 40 kaki untuk membawa satu beg kecil dari Melaka ke Kuala Lumpur. Lori itu memang mampu menyiapkan kerja, tetapi sebuah Kancil sudah mencukupi dengan minyak dan kos penyelenggaraan yang jauh lebih rendah. Itulah prinsip Smart Routing: pilih enjin pemprosesan yang betul untuk tugas yang betul.
Di NeuralOps, Detached System Builder Agent kami menggunakan LLM tempatan, Guard Rails, dan Smart Routing untuk mereka bentuk dan membina sistem. Penggunaan token memang tinggi semasa fasa pembelajaran awal, pembangunan, ujian, dan pengesahan-tetapi fasa ini bersifat sementara sahaja.
Sebaik sahaja Detached System siap, operasi berulang dialihkan kepada peraturan tetap, servis PHP, skrip automasi, pangkalan data, dan aliran kerja yang telah disahkan. Sistem itu kemudiannya berjalan tanpa henti tanpa memerlukan LLM untuk memproses setiap transaksi.
Hasilnya, penggunaan token bulanan boleh jatuh dari kira-kira 32 bilion token kepada hanya 1.5–2 bilion token, kebanyakannya untuk pengecualian, kes tidak diketahui, penambahbaikan sistem, dan tugas yang benar-benar memerlukan AI. Dalam sesetengah kes penggunaan, aliran kerja detached teras mungkin beroperasi dalam lingkungan USD20 sebulan, bergantung kepada infrastruktur dan beban kerja.
Keputusan utama dari sudut operasi:
Penggunaan token lebih rendah
Kos operasi jangka panjang lebih rendah
Penggunaan LLM tempatan untuk kawalan lebih baik
Guard Rails bagi output yang boleh diramal
Smart Routing supaya model besar tidak digunakan untuk kerja kecil
AI hanya dipanggil bila AI benar-benar diperlukan
Aliran kerja detached yang terus berjalan tanpa caj token berulang
Prinsip NeuralOps mudah:
Jangan guna lori kalau Kancil sudah cukup. AI membina sistem; selepas itu sistem bergerak sendiri.


