Bergantung kepada model, arkitektur, dan corak penggunaan, kos operasi boleh dengan mudah mencecah ratusan ribu dolar. Masalahnya bukan selalunya AI itu mahal. Kebanyakan masalah sebenar berpunca daripada penggunaan LLM bersaiz besar untuk setiap tugas, termasuk kerja-kerja yang sebenarnya boleh ditangani oleh peraturan mudah, skrip, pangkalan data, atau model tempatan yang lebih kecil.
Ia serupa dengan menggunakan lori berat untuk menghantar satu beg kecil dari Melaka ke Kuala Lumpur. Lori itu boleh menyiapkan tugas, tetapi Kancil boleh menghantar barangan yang sama dengan jauh lebih rendah penggunaan bahan api dan kos operasi. Inilah prinsip di sebalik Smart Routing: gunakan enjin pemprosesan yang betul untuk tugas yang betul.
Dari sudut operasi logistik dan pembangunan sistem yang saya uruskan di AINNA, ejen Detached System Builder dalam NeuralOps menggunakan LLM tempatan, Guard Rails, dan Smart Routing untuk mereka bentuk dan membina keseluruhan sistem. Penggunaan token memang ketara semasa fasa pembelajaran awal, pembangunan, ujian, dan pengesahan - tetapi ini adalah penggunaan sementara.
Setelah Detached System siap sepenuhnya, operasi berulang dipindahkan kepada peraturan tetap, perkhidmatan PHP, skrip automasi, pangkalan data, dan aliran kerja yang telah disahkan. Sistem kemudian boleh beroperasi berterusan tanpa memerlukan LLM untuk memproses setiap transaksi.
Hasilnya, penggunaan bulanan boleh menurun dari kira-kira 32 bilion token kepada hanya 1.5β2 bilion token, kebanyakannya untuk pengecualian, kes tidak dikenali, penambahbaikan sistem, dan tugas yang benar-benar memerlukan AI. Dalam sesetengah kes penggunaan, aliran kerja teras detached itu sendiri mungkin beroperasi dengan kos sekitar USD20 sebulan, bergantung kepada infrastruktur dan beban kerja.
Hasil utama:
Penggunaan token lebih rendah
Kos operasi jangka panjang lebih rendah
Penggunaan LLM tempatan untuk kawalan lebih baik
Guard Rails bagi output yang boleh diramalkan
Smart Routing bagi mengelakkan penggunaan model yang terlalu besar
AI digunakan hanya apabila AI benar-benar diperlukan
Aliran kerja detached yang terus beroperasi tanpa caj token berulang
Prinsip NeuralOps mudah:
Jangan gunakan lori jika Kancil boleh menyiapkan tugas. AI membina sistem. Sistem kemudian beroperasi secara bebas.