Salah satu usaha saya dalam menampung kos distilasi LLM sendiri ialah dengan membina lebih banyak Sistem Terpisah.
Prinsipnya mudah:
Jangan gunakan LLM untuk kerja yang sudah menjadi boleh diramal.
Setiap minggu, saya menyasarkan untuk membina kira-kira dua belas Sistem Terpisah besar, disokong oleh penyelidikan yang diperlukan untuk memahami aliran kerja, mengenal pasti corak, mentakrifkan peraturan, dan mengesahkan sistem.
Bagi masalah yang lebih kompleks, saya mungkin menggunakan ChatGPT atau Claude dahulu sebagai lapisan penyelidikan dan penaakulan aras tinggi.
Aliran kerjanya kemudian menjadi:
Masalah Kompleks → Penyelidikan → Penaakulan → Distilasi → Logik Deterministik → Perutean Pintar → DeepSeek V4 Flash / LLM Sendiri Kita → Pelaksanaan
Bahagian penting ialah apa yang berlaku selepas logik deterministik.
Jika beban kerja boleh diselesaikan melalui peraturan, penghurai, pengesahan, atau logik berstruktur, Sistem Terpisah mengendalikannya secara langsung.
Jika lebih banyak penaakulan diperlukan, beban kerja dihantar ke DeepSeek V4 Flash sebagai model luar yang cekap kos.
Bagi beban kerja yang khusus, strategik, sensitif, atau berkaitan kedaulatan, sistem sebaliknya boleh menghantar tugas ke model LLM sendiri kita.
Jadi ini bukan tentang menghapuskan LLM.
Ia tentang menggunakannya secara selektif.
Deterministik dahulu.
LLM cekap kos apabila diperlukan.
LLM sendiri kita apabila kecerdasan khusus, kawalan, atau kedaulatan menjadi faktor penting.
Arsitektur ini juga menyokong ekonomi pembinaan model kita sendiri.
Lebih banyak beban kerja yang kita pisahkan, lebih rendah kos token dan inferens berulang kita.
Lebih rendah kos tersebut, lebih banyak sumber yang boleh kita tumpukan kepada distilasi model, penilaian, infrastruktur, dan pembangunan ekosistem LLM sendiri kita.
Itu ialah salah satu idea teras di sebalik AINNA NeuralOps.
#AINNA #NeuralOps #DetachedSystems #LLM #AIDistillation #SovereignAI #AIInfrastructure #DeepSeek #ChatGPT #Claude #EnterpriseAI #Automasi


