Salah satu usaha saya untuk menampung kos penyulingan LLM sendiri ialah dengan membina lebih banyak Sistem Terasing.
Prinsipnya ringkas:
Jangan gunakan LLM untuk kerja yang sudah boleh diramalkan.
Setiap minggu, saya menyasarkan untuk membina kira-kira dua belas Sistem Terasing yang berat, disokong oleh penyelidikan yang diperlukan untuk memahami aliran kerja, mengenal pasti corak, menentukan peraturan, dan mengesahkan sistem.
Bagi masalah yang lebih kompleks, saya mungkin menggunakan ChatGPT atau Claude dahulu sebagai lapisan penaakulan dan penyelidikan peringkat tinggi.
Aliran prosesnya kemudian menjadi:
Masalah Kompleks → Penyelidikan → Penaakulan → Penyulingan → Logik Deterministik → Penghalaan Pintar → DeepSeek V4 Flash / LLM Sendiri → Pelaksanaan
Bahagian penting ialah apa yang berlaku selepas logik deterministik.
Jika bebanan kerja boleh diselesaikan menerusi peraturan, penghurai, pengesahan, atau logik berstruktur, Sistem Terasing akan mengendalikannya secara langsung.
Jika lebih banyak penaakulan diperlukan, bebanan kerja dihala kepada DeepSeek V4 Flash sebagai model luar yang cekap kos.
Bagi bebanan kerja yang khusus, strategik, sensitif, atau berkaitan kedaulatan, sistem boleh menghala tugas tersebut kepada model LLM sendiri pula.
Jadi, ini bukanlah tentang menghapuskan LLM.
Ia adalah tentang menggunakannya secara selektif.
Deterministik dahulu.
LLM yang cekap kos apabila diperlukan.
LLM sendiri apabila kecerdasan khusus, kawalan, atau kedaulatan menjadi penting.
Senibina ini juga menyokong ekonomi pembangunan model sendiri.
Semakin banyak bebanan kerja yang kita asingkan, semakin rendah kos token dan inferens yang berulang.
Semakin rendah kos tersebut, semakin banyak sumber yang boleh kita alihkan semula kepada penyulingan model, penilaian, infrastruktur, dan pembangunan ekosistem LLM sendiri.
Itu adalah salah satu idea teras di sebalik AINNA NeuralOps.
#AINNA #NeuralOps #DetachedSystems #LLM #AIDistillation #SovereignAI #AIInfrastructure #DeepSeek #ChatGPT #Claude #EnterpriseAI #Automasi


