Operasi AI skala besar: bagaimana kami turunkan penggunaan token daripada 32 bilion ke bawah 2 bilion sebulan✎ Edit

👁 1.1k tontonan
Operasi AI skala besar: bagaimana kami turunkan penggunaan token daripada 32 bilion ke bawah 2 bilion sebulan

Kalau tengok dari sudut operasi, kos bulanan AI boleh melonjak tinggi bergantung pada model, struktur sistem, dan corak penggunaan. Tetapi masalah sebenar bukan semestinya AI itu mahal. Kebanyakan syarikat guna LLM besar untuk setiap tugas, termasuk kerja-kerja yang sebenarnya boleh diselesaikan dengan peraturan mudah, script, database, atau model tempatan yang lebih kecil.

Sama macam guna lori treler untuk hantar satu beg kecil dari Melaka ke Kuala Lumpur. Lori memang boleh buat kerja itu, tapi Kancil pun boleh hantar barang yang sama dengan jauh lebih jimat minyak dan kos penyelenggaraan. Itu prinsip Smart Routing: guna enjin pemprosesan yang sesuai dengan tugas tertentu.

Di NeuralOps, Sistem Berasingan Builder Agent kami menggunakan LLM tempatan, Guard Rails, dan Smart Routing untuk mereka dan bina sistem. Penggunaan token memang tinggi pada peringkat awal - untuk pembelajaran, pembangunan, ujian, dan validasi - tetapi fasa ini sementara sahaja.

Sebaik sahaja Sistem Berasingan siap, operasi berulang akan dialihkan kepada peraturan tetap, perkhidmatan PHP, skrip automasi, database, dan aliran kerja yang telah disahkan. Sistem itu kemudian boleh berjalan berterusan tanpa perlu LLM memproses setiap transaksi.

Hasilnya, penggunaan token bulanan boleh turun dari kira-kira 32 bilion token kepada hanya 1.5–2 bilion token, kebanyakannya untuk pengecualian, kes tidak dikenali, penambahbaikan sistem, dan tugas yang benar-benar memerlukan AI. Dalam sesetengah kes gunaan, aliran kerja detached utama itu sendiri boleh beroperasi dalam lingkungan USD20 sebulan, bergantung pada infrastruktur dan beban kerja.

Apa yang kami perhatikan di lapangan:

  • Penggunaan token lebih rendah

  • Kos operasi jangka panjang lebih jimat

  • LLM tempatan untuk kawalan lebih baik

  • Guard Rails bagi output yang lebih boleh diramal

  • Smart Routing supaya tidak bergantung pada model yang terlalu besar

  • AI digunakan hanya apabila AI benar-benar diperlukan

  • Aliran kerja detached yang terus berjalan tanpa caj token berulang

Prinsip NeuralOps mudah sahaja:

Jangan guna lori kalau Kancil boleh buat kerja itu. AI bina sistem. Kemudian sistem itu berjalan sendiri.

Artificial Intelligence

Article image
Edge AI IoT & embedded Linux intelligence at the edge 14 edge agents → offline-capable Terokai →
SmartCity AI-powered smart city infrastructure & operations 24 domains → one intelligent operating layer Terokai →
IC DesignOps Repeatability, traceability & verification intelligence 21 detached services → 85% without LLM Terokai →
Robotics Robotik terurus di edge industri Perception → safety gateway → controller Terokai →
Ekosistem AINNA

Keep exploring after this article.

Every article page should end with a clear path into the wider AINNA, Agent, and NeuralOps ecosystem.

Semasa topic Artificial Intelligence Author profile Firdaus AINNA Main ecosystem hab Agent Pusat ejen autonomi persendirian NeuralOps AI automation and business systems Lead form Mula a pilot discussion
AINNA Agent AI

Deploy Our AINNA Ejen AI

Linux is the core path, Windows is supported, and Android / Termux works as the companion layer.

Linux / macOS curl -fsSL https://neuralops.bond/install | bash
Verify ainna --version
AINNA
KLIK SAYA
Rotating Earth

Seksyen Laman

Tiada data seksyen tersedia buat masa ini.

Laman dengan seksyen terdokumen akan dipaparkan di sini.