
Enam tahun lepas, saya masih ingat bagaimana satu proof-of-concept boleh dijalankan hanya dengan notebook murah, menjalankan chatbot engine melalui sambungan Chrome pada Lubuntu.
Tapi pada 2026, China mengubah keseluruhan parameter perancangan operasi.
Hari ini, sebagai production planner, saya melihat kemungkinan merancang deployment beribu-ribu VPS instance, setiap satunya menjalankan detached systems tersendiri dan dikawal oleh AI agents, pada kos operasi yang lebih rendah berbanding notebook murah saya enam tahun lalu.
Bayangkan parameter kos dan kapasiti ini:
USD10–12 setahun untuk satu VPS instance yang mampu menjalankan beratus-ratus lightweight detached systems, kebanyakannya PHP microservices.
Sistem-sistem ini boleh dibina, dipantau, diselenggara, diuji, dan diuruskan oleh lima jenis AI agents yang berbeza - satu setup yang memerlukan koordinasi operasi yang ketat.
Tambah anggaran USD20–30 sebulan untuk LLM usage, dan keseluruhan infrastruktur boleh beroperasi 24 jam sehari tanpa henti.
Ekonomi operasi menjadi lebih menarik apabila anda sudah memiliki GPU machine, seperti yang sering dimiliki oleh gamers.
Jalankan vLLM dengan local LLMs yang berupaya pada peringkat lebih rendah, sambungkan VPS instances secara selamat, dan kos inferens model boleh dikekalkan hampir sifar selain daripada elektrik dan penyelenggaraan peralatan.
Cheap VPS.
Local inference.
Autonomous AI agents.
Hundreds of detached systems.
Continuous operation.
Ini bukan lagi sekadar soalan membina chatbot.
Ini tentang bagaimana kita merancang dan melaksanakan distributed, autonomous digital workforce pada kos yang amat rendah.
Dari perspektif perancangan dan operasi, hanya masalah masa sebelum seni bina ini dijadikan senjata oleh kerajaan, korporat, rangkaian jenayah, atau organisasi ketenteraan.
Teknologi semakin murah.
Soalan sebenar bukan lagi sama ada ia boleh dilakukan.
Soalannya ialah: siapa yang akan melancarkannya dahulu, dan untuk tujuan apa?
Itu perspektif saya dari sudut perancangan dan operasi.


