AI Strategy & Consulting
AI readiness assessment, use-case identification, enterprise roadmap, architecture planning, model selection, and smart routing strategy.
Discuss Pelaksanaan →NeuralOps — AI Automasi & Perniagaan Systems by AINNA
NeuralOps is AINNA’s AI automation and operational intelligence platform. LLM Persendirian infrastructure, detached agents, smart routing and governed workflows — so PKS can automate operations safely with data staying local.
Direct Answer
AINNA AI provides enterprise AI infrastructure, private AI, local LLM deployment, agentic AI, automation, data intelligence and governed NeuralOps patterns for Malaysian organisations that need practical delivery, not generic demos.
Perkhidmatan AI
A complete service stack strategy, private infrastructure, local models, agents, automation, data intelligence, and governed deployment.
AI readiness assessment, use-case identification, enterprise roadmap, architecture planning, model selection, and smart routing strategy.
Discuss Pelaksanaan →Peribadi vLLM, VPS infrastructure, VPN-secured access, controlled inference, private AI gateway, and model hosting with infrastructure segmentation.
View Seni Bina →Tempatan model deployment, evaluation, quantized models, multi-model architecture, model routing and segmentation, inference optimization, and lifecycle management.
Explore LLM Hub →Enterprise, operations, finance, customer-support, research, monitoring, and executive-intelligence agents plus governed multi-agen systems.
Explore Agent Hub →PLAN → DESIGN → BUILD → TEST → VALIDATE → HUMAN APPROVAL → DEPLOY → MONITOR, with audit trails and controlled execution.
Pelajari Lagi →Aliran Kerja, business-process, and data automation; API/system integration; scheduled and event-driven operations; human-approval workflows; monitoring.
Pelajari Lagi →AI builds → validate → detach → the system runs. Deterministic systems can continue operating without continuous LLM inference where appropriate.
Pelajari Lagi →Data extraction, document parsing, classification, normalization, validation, reconciliation, and structured business data pipelines.
Pelajari Lagi →Enterprise knowledge base, secure RAG, internal and semantic search, knowledge agents, and document retrieval with governed answers.
Pelajari Lagi →AI-enabled web systems, business applications, internal dashboards, API and database systems, automation portals, and custom enterprise alatan.
Mulakan Perintis →ERP, CRM, ecommerce, database, API, and legacy-system integration plus agen-to-system integration and internal systems.
View Seni Bina →Manusia approval, RBAC, logging, audit trail, usage policy, model access control, data boundaries, monitoring, and operational guardrails.
Pelajari Lagi →Smart routing, model segmentation, small-model routing, deterministic processing, detached systems, and inference optimization.
Explore Strategi LLM →Peribadi network architecture, local AI, controlled access, VPN-based inference, VPS segmentation, logging, and policy enforcement.
View Kedaulatan →Infrastruktur, agen, workflow, model, and performance monitoring; incident detection; usage reporting; and system maintenance.
Mulakan Perintis →NeuralOps Perkhidmatan Stack
Each layer builds on the one below it from private infrastructure to business outcome.
Industri
NeuralOps adapts to how each industry actually works with governed, private, and detached AI that fits the operational context.
Inventori intelligence, marketplace operations, sales analytics, pricing, order automation, and customer-service agents.
Bank statement processing, financial data extraction, reconciliation, reporting, accounting automation, and cash flow intelligence.
Production monitoring, predictive maintenance, quality control, machine data, inventory planning, and industrial AI agents.
City operations intelligence, infrastructure and traffic monitoring, utility management, and public service automation.
Institutional knowledge, secure internal AI, document intelligence, workflow automation, and audit & governance.
Document intelligence, administrative automation, knowledge retrieval, research assistance, and data governance.
Document processing, contract intelligence, knowledge retrieval, classification, and controlled human review.
Ladang monitoring, crop and environmental data, resource optimization, sensor integration, and yield analytics.
Tenaga monitoring, grid and asset intelligence, consumption analytics, maintenance, and forecasting.
Shipment monitoring, route intelligence, warehouse automation, inventory visibility, and exception detection.
Building operations, maintenance automation, energy monitoring, asset management, and tenant service agents.
Branch monitoring, franchise compliance, sales intelligence, inventory monitoring, and commission automation.
Rangkaian operations, infrastructure monitoring, incident workflow, customer operations, and support automation.
Institutional knowledge, administrative automation, research assistance, and internal knowledge retrieval.
Project monitoring, technical knowledge, document processing, asset tracking, and procurement workflows.
Industry × AI Perkhidmatan Matriks
Select an industry to see the recommended NeuralOps services and the direct industry solution page.
| Perkhidmatan | Peruncitan | Kewangan | Pembuatan | Kerajaan | Smart City |
|---|---|---|---|---|---|
| Peribadi AI | |||||
| Ejen AI | |||||
| Automasi | |||||
| Sistem Berasingan | |||||
| Perisikan Data | |||||
| Tadbir Urus |
Pengguna tidak pernah menyambung ke pelayan vLLM secara langsung. Permintaan pergi ke VPS ditentukan dahulu, kemudian VPS memanggil vLLM pusat melalui terowong WireGuard VPN peribadi.
Aplikasi perniagaan, ejen, papan pemuka dan automasi anda berjalan pada VPS terasing. VPS ini menjadi satu-satunya nod pelaksanaan yang diluluskan untuk aliran kerja AI anda.
AINNA mencipta terowong WireGuard antara VPS anda dan pelayan vLLM pusat. IP VPS dan kelayakan terowong disenarai putih. Trafik awam ditolak secara reka bentuk.
Ejen send prompts through VPN, vLLM returns model output, and operations continue on the VPS. Public API keys are not required, and the model backend is not exposed in the default deployment model.
This private infrastructure layer is one part of the Kecekapan Flywheel: Segmentation → Smart Routing → Distillation → Sistem Berasingan → Peribadi Infrastruktur. For suitable workloads we use the smallest sufficient layer at each step. 87% token reduction is an internal benchmark on tested patterns.
Tindanan infrastruktur AI lengkap daripada model setempat hingga ejen autonomi.
Infrastruktur AI persendirian yang berjalan secara on-premise
Keselamatan gred perusahaan dan kedaulatan data
Agen autonomi yang melaksanakan aliran kerja kompleks
Reka bentuk dan deploy ejen AI tersuai
Infrastruktur AI persendirian yang berjalan secara on-premise
Keselamatan gred perusahaan dan kedaulatan data
Agen autonomi yang melaksanakan aliran kerja kompleks
Reka bentuk dan deploy ejen AI tersuai
Each layer reduces unnecessary work for the next. The system gets lebih murah, lebih pantas, and more reliable the more you use it correctly.
Result: lower cost per outcome, lebih pantas execution, easier auditing, and compounding savings as volume grows. The flywheel only works when every layer is used in the right order.
Semasa: Smart routing, distillation for scoped tasks, detached systems, and private infrastructure are in production for suitable workloads (internal 87% token benchmark on tested patterns). Peta Hala Tuju: Larger inference clusters and deeper autonomous layers are Phase 2 (funding-dependent). The flywheel above shows how the layers compound.
Infrastruktur AI bertaraf perusahaan dengan keselamatan VPN sahaja. Hanya deployment persendirian. Direka untuk pendedahan data terkawal.
Untuk perniagaan kecil dan permulaan
Untuk syarikat berkembang dan e-dagang
Untuk perusahaan dan keperluan keselamatan tinggi
Bukan LLM peribadi setiap pelanggan. Satu pelayan vLLM berpusat. Instans VPS yang dibenarkan disambungkan melalui VPN. Akses awam dimatikan dalam deployment lalai. Seni bina hab-dan-spoke.
This private infrastructure is the final layer of the Kecekapan Flywheel (Segmentation → Smart Routing → Distillation → Sistem Berasingan → Peribadi Infrastruktur). Semasa for suitable workloads; larger clusters are Phase 2.
Tiada pengasingan model setiap klien. Sebaliknya, satu pelayan vLLM dioptimumkan dikongsi melalui terowong VPN selamat lebih cekap dan sama selamat.
Satu pelayan menjalankan 7 model LLM. Sumber GPU digunakan sepenuhnya. Pemantauan, kemas kini dan tampalan keselamatan berpusat.
Only designated VPS instances with whitelisted VPN credentials can connect. Public API keys are not required. Public endpoints are not exposed in the default deployment model.
Port inferens kekal peribadi dalam deployment lalai. Akses pentadbiran dihadkan, bahagian belakang model tidak didedahkan kepada awam, dan akses GPU langsung dari luar disekat.
Pelayan vLLM pusat disambungkan ke spoke VPS terasing melalui VPN. Jika satu VPS gagal, yang lain kekal tidak terjejas. Pelayan LLM kekal dilindungi.
Setiap permintaan inferens dilog. Pemantauan berpusat merentasi semua sambungan VPS. Kebolehauditan lengkap untuk pematuhan.
Tiada pengasingan model setiap klien. Sebaliknya, satu pelayan vLLM dioptimumkan dikongsi melalui terowong VPN selamat lebih cekap dan sama selamat.
Satu pelayan menjalankan 7 model LLM. Sumber GPU digunakan sepenuhnya. Pemantauan, kemas kini dan tampalan keselamatan berpusat.
Hanya instans VPS ditentukan dengan kelayakan VPN disenarai putih boleh disambungkan. Akses dikendalikan secara persendirian, dan titik akhir awam tidak didedahkan dalam model deployment lalai.
Port inferens kekal peribadi dalam deployment lalai. Akses pentadbiran dihadkan, bahagian belakang model tidak didedahkan kepada awam, dan akses GPU langsung dari luar disekat.
Pelayan vLLM pusat disambungkan ke spoke VPS terasing melalui VPN. Jika satu VPS gagal, yang lain kekal tidak terjejas. Pelayan LLM kekal dilindungi.
Setiap permintaan inferens dilog. Pemantauan berpusat merentasi semua sambungan VPS. Kebolehauditan lengkap untuk pematuhan.
Data anda tidak pernah keluar dari persekitaran terkawal anda. Semua inferens berlaku di sebalik VPN. Panggilan API pihak ketiga dielakkan jika boleh, dan pendedahan data kepada model awam direka untuk dikawal. Dasar keselamatan (kebijakan keselamatan) dikuatkuasakan di perimeter rangkaian.
Data perniagaan kekal di sini. Ejen memproses, ejen melaksanakan. Tiada data keluar dari zon terasing anda.
Hanya teks prom melalui. Disulitkan sepenuhnya. Tiada log tersimpan data anda.
Menerima prom → mengembalikan output. Tiada data disimpan. Tiada data dilog. Tiada data dikongsi.
Supported bank-statement formats can be converted into structured financial records through dedicated parsers and validation. Jualan, inventory, listings, advertising, logistics, and customer behaviour require source-specific connectors or custom parser integrations before downstream dashboards and models are built.
Ekstrak pandangan daripada data operasi
Penjanaan dipertingkat pengambilan dengan data anda
Carian dan pengambilan semantik berprestasi tinggi
Sistem dibina AI yang berjalan secara bebas
Ekstrak pandangan daripada data operasi
Penjanaan dipertingkat pengambilan dengan data anda
Carian dan pengambilan semantik berprestasi tinggi
Sistem dibina AI yang berjalan secara bebas
AINNA mengautomasikan proses perniagaan berulang merentasi e-dagang, inventori, pelaporan, pengurusan penyenaraian, operasi dan aliran kerja dalaman. Matlamatnya bukan sekadar automasi, tetapi orkestrasi pintar antara data, peraturan, manusia dan sistem.
Pengurusan kedai dalam talian hujung ke hujung
Penjejakan stok dan amaran masa nyata
Analitik dan pandangan hasil automatik
Ramalan dan trend dikuasakan ML
Pengurusan kedai dalam talian hujung ke hujung
Penjejakan stok dan amaran masa nyata
Analitik dan pandangan hasil automatik
Ramalan dan trend dikuasakan ML
Daripada hanya bergantung pada antara muka chatbot, AINNA menggunakan AI sebagai pembina sistem mereka bentuk, menjana, membaiki dan mengoptimumkan aplikasi perniagaan yang terus beroperasi secara bebas selepas deployment.
The operating model is the Kecekapan Flywheel: Segmentation → Smart Routing → Distillation → Sistem Berasingan → Peribadi Infrastruktur. Semasa production for suitable workloads. 87% token reduction is an internal benchmark on tested patterns. Peta Hala Tuju items (larger clusters, deeper autonomy) are Phase 2.
Setiap sistem direka untuk hasil perniagaan tertentu, bukan perbualan generik.
Logik perniagaan, data dan pandangan anda kekal di bawah kawalan anda tiada kebergantungan luaran.
Systems continue running after deployment, requiring minimal maintenance and zero token costs for execution (infrastructure still applies separately).
Segmentation → Smart Routing → Distillation → Sistem Berasingan → Peribadi Infrastruktur. Each layer reduces unnecessary work. Semasa for suitable workloads; 87% token reduction is an internal benchmark on tested patterns.
Logik perniagaan, data dan pandangan anda kekal di bawah kawalan anda tiada kebergantungan luaran.
Systems continue running after deployment, requiring minimal maintenance and zero token costs for execution (infrastructure still applies separately).
AINNA membangunkan Ejen AI yang membantu dalam perancangan sistem, penjanaan kod, reka bentuk aliran kerja, pemetaan data, pengesanan ralat, dokumentasi, pengoptimuman dan pembaikan sistem. Ejen ini bukan bot tanpa kawalan. Mereka beroperasi dalam peraturan perniagaan yang jelas, lapisan kelulusan manusia dan sempadan sistem yang ditetapkan.
Ejen menganalisis keperluan perniagaan dan mereka bentuk struktur sistem yang optimum.
Pembangunan dibantu AI menghasilkan kod yang bersih dan sedia untuk pengeluaran.
Ejen mengenal pasti pepijat, kes tepi dan isu prestasi kemudian membetulkannya.
Setiap tindakan ejen mematuhi peraturan perniagaan dengan kelulusan manusia dan jejak audit.
Ejen menganalisis keperluan perniagaan dan mereka bentuk struktur sistem yang optimum.
Pembangunan dibantu AI menghasilkan kod yang bersih dan sedia untuk pengeluaran.
Ejen mengenal pasti pepijat, kes tepi dan isu prestasi kemudian membetulkannya.
Setiap tindakan ejen mematuhi peraturan perniagaan dengan kelulusan manusia dan jejak audit.
Mula at the secured platform hab, route through the multi-model orchestra, then deploy on-prem when data sovereignty is non-negotiable.
VPN-secured central vLLM
Ejen and VPS nodes connect through whitelisted WireGuard tunnels no public inference endpoints.
You are here 02Sistem vLLM 7-model
Hala beban kerja merentasi model khusus dengan kecekapan GPU berpusat dan sifar bil awan per token.
DistilRight size for the workload
Transfer capability into lebih kecil, lebih pantas, lebih murah specialist models for high-volume, well-scoped tasks.
03Tempatan models · zero data leakage
Run models inside your building when PDPA, sector rules, or air-gapped policy require full data residency.
Pelayan vLLM adalah lapisan inferens peribadi. Ia berjalan secara berpusat untuk prestasi dan kecekapan model, tetapi tidak kelihatan kepada internet awam. Hanya nod VPS ditentukan boleh memanggilnya melalui VPN disulitkan.
Akses persendirian sahaja · Port inferens persendirian · Akses pentadbir terhad · Tiada akses GPU langsung · VPS disenarai putih sahaja.
Pelayan vLLM hanya boleh dicapai dari nod VPS yang diluluskan melalui terowong WireGuard peribadi.
Bahagian belakang model tidak boleh dicapai secara langsung dari internet awam.
Aliran kerja Generic Agent AI, OpenCode, Sistem Detached dan Hermes berjalan pada VPS, bukan pada pelayan GPU.
vLLM pusat boleh menyediakan pelbagai model sambil mengekalkan akses terkawal melalui penghalaan VPN sahaja.
Pelayan vLLM hanya boleh dicapai dari nod VPS yang diluluskan melalui terowong WireGuard peribadi.
Bahagian belakang model tidak boleh dicapai secara langsung dari internet awam.
Aliran kerja Generic Agent AI, OpenCode, Sistem Detached dan Hermes berjalan pada VPS, bukan pada pelayan GPU.
vLLM pusat boleh menyediakan pelbagai model sambil mengekalkan akses terkawal melalui penghalaan VPN sahaja.
Large general models are powerful but expensive. For high-volume, well-scoped tasks we distil capability into lebih kecil, lebih pantas, lebih murah specialist models that run with lower latency and lower cost while preserving accuracy for that narrow job. Distillation is an engineering process with evaluation gates, not magic.
Explore Model Distillation → See Segmentation & Penghalaan →
Part of the Kecekapan Flywheel (current for suitable workloads; 87% internal benchmark on tested patterns).
AI mereka bentuk, membangun, dan mengesahkan aliran kerja sekali kemudian sistem berasingan berjalan di atas PHP, peraturan, pangkalan data, dan automasi tanpa inferens berulang.
This is step 4 of the Kecekapan Flywheel (Segmentation → Penghalaan → Distillation → Detached → Peribadi Infra). 87% token reduction is an internal benchmark on tested workloads.
Explore Sistem Berasingan →Model AINNA adalah kawalan-utama. Kelulusan manusia-dalam-gelung, jejak audit, log sistem, kawalan akses, kebenaran berasaskan peranan, pemantauan, kebolehcerapan dan penguatkuasaan peraturan perniagaan disertakan untuk memastikan penggunaan AI selamat, boleh dijelaskan dan boleh diurus.
Kelulusan manusia-dalam-gelung, jejak audit, log sistem, kawalan akses dan penguatkuasaan peraturan perniagaan.
Setiap keputusan automatik boleh dijejaki dan dijelaskan dengan laluan eskalasi yang jelas.
Aliran kerja kelulusan untuk keputusan kritikal dengan tahap risiko yang boleh dikonfigurasi.
Log lengkap, papan pemuka kebolehcerapan dan semakan pematuhan.
Data anda tidak pernah keluar dari persekitaran VPS terkawal anda. Dasar keselamatan dikuatkuasakan di perimeter rangkaian. Tiada pendedahan pihak ketiga.
Setiap keputusan automatik boleh dijejaki dan dijelaskan dengan laluan eskalasi yang jelas.
Aliran kerja kelulusan untuk keputusan kritikal dengan tahap risiko yang boleh dikonfigurasi.
Log lengkap, papan pemuka kebolehcerapan dan semakan pematuhan.
Citation-style ringkasan based on verified operating facts from the live AINNA commerce environment.
AINNA's AI architecture evolved inside a live multi-store commerce environment with more than 80,000 SKU aktif, 9,000 pesanan bulanan, 30 kedai rasmi and RM15M+ in lifetime sales. These figures describe the operating environment, not AI performance.
Dagangan operations required better control over catalogue breadth, order flow, store coordination, reporting and repeatable workflows across channels.
The environment involved multiple stores, frequent product changes, operational reporting pressure and the need to keep deterministic business rules visible.
NeuralOps routing, detached systems, controlled validation and private AI components were used to separate repeatable work from model-heavy work.
The AI layer handled language-heavy tasks, orchestration support and classification where flexible reasoning helped. It was not used as the only decision point.
Detached systems handled routing, validation, inventory logik, order checks and other repeatable business rules before action was taken.
The public evidence supports a practical AI operating model that fits real commerce pressure, not a purely experimental demo.
This is an operational case study, not a controlled academic experiment. The figures should not be read as universal AI benchmark claims.
Suggested citation: AINNA. "AINNA Operational Kajian Kes." AINNA Penyelidikan, 2026. See also Penyelidikan Hub and NeuralOps Seni Bina.
Pitch 1 mewakili model pengembangan AINNA menggabungkan pengalaman perniagaan, infrastruktur AI, pembangunan sistem detached dan pelaksanaan dipacu data ke dalam rangka kerja berskala untuk transformasi PKS.
Bukti konsep kes penggunaan tunggal dengan ROI yang boleh diukur.
Kembangkan kepada pelbagai pasukan dan integrasikan dengan sistem teras.
Ekosistem AI seluruh organisasi dengan automasi penuh.
Rangka kerja berskala untuk transformasi PKS.
Bukti konsep kes penggunaan tunggal dengan ROI yang boleh diukur.
Kembangkan kepada pelbagai pasukan dan integrasikan dengan sistem teras.
Ekosistem AI seluruh organisasi dengan automasi penuh.
Rangka kerja berskala untuk transformasi PKS.
Infrastruktur AI selamat disesuaikan dengan keperluan pematuhan dan sensitiviti data industri anda.
Penjanaan penerangan produk, ejen perkhidmatan pelanggan, ramalan inventori dan pengurusan penyenaraian automatik merentasi pelbagai kedai.
Analisis dokumen, semakan kontrak, penyelidikan undang-undang kes data sulit kekal di sebalik VPN anda dalam deployment lalai. Tiada pendedahan pihak ketiga.
Patient data processing, clinical report generation, medical record analysis designed to support PDPA-aligned deployment controls, with data processing kept within the VPS in the default model.
Penjanaan laporan, pemantauan pematuhan, pengesanan penipuan, analisis risiko selamat, boleh diaudit, dengan log inferens lengkap.
Automasi perkhidmatan rakyat, pemprosesan dokumen, analisis dasar infrastruktur AI berdaulat dengan kawalan data berasaskan Malaysia.
Pemantauan sensor IoT, penyelenggaraan ramalan, automasi kawalan kualiti, pengoptimuman rantaian bekalan dengan pelaksanaan ejen masa nyata.
NeuralOps melindungi kedaulatan dengan memisahkan akses pengguna, pelaksanaan ejen dan inferens LLM. Pengguna mencapai lapisan VPS/aplikasi. Hanya VPS ditentukan mencapai vLLM melalui VPN.
Pengguna berinteraksi dengan aplikasi, papan pemuka, API atau ejen anda yang berjalan pada VPS. Bahagian awam berakhir di sini. Pelayan vLLM tidak pernah didedahkan sebagai destinasi awam.
VPS menggunakan kelayakan WireGuard dan laluan IP yang diluluskan. Jika trafik tidak berasal dari terowong VPS dibenarkan, lapisan vLLM menolaknya.
Pelayan LLM menerima prom terkawal melalui VPN dan mengembalikan output. Ia tidak digunakan sebagai lapisan penyimpanan, lapisan aplikasi web atau titik integrasi awam.
Semua pelayan dan instans VPS dihoskan dalam sempadan Malaysia. Data anda tertakluk kepada undang-undang Malaysia (PDPA 2010), bukan bidang kuasa asing seperti Akta Awan AS atau GDPR.
Berbeza daripada penyelesaian yang proksi melalui API OpenAI/Google/xAI, NeuralOps tidak membuat panggilan API luaran. Prom anda tidak pernah sampai ke pelayan asing. Inferens 100% setempat pada infrastruktur kami.
VPS setiap pelanggan diasingkan pada peringkat hiperpengawas awan. Tiada penyewa lain boleh mengakses fail, proses atau memori anda. Data anda kekal dalam sempadan maya anda.
AINNA tidak dapat melihat data anda. Kami mengurus infrastruktur, bukan kandungan anda. Terowong VPN dan penyulitan VPS memastikan data anda tidak dapat dibaca oleh sesiapa kecuali ejen anda yang dibenarkan.
Kedaulatan data adalah asas pematuhan PDPA. Dengan mengekalkan data peribadi dalam Malaysia dan di bawah kawalan anda, NeuralOps memenuhi Seksyen 129 (sekatan pemindahan data) secara automatik.
Semua permintaan inferens dilog untuk pematuhan tetapi hanya metadata (cap masa, kiraan token, model digunakan). Kandungan prom sebenar tidak pernah dilog. Anda mendapat kebolehauditan tanpa pendedahan.
Lihat bagaimana NeuralOps berbanding dengan OpenAI, Google Gemini dan penyelesaian hos sendiri merentasi dimensi keselamatan, kedaulatan dan kawalan.
| Ciri | NeuralOps | OpenAI API | Google Gemini | Hos Sendiri |
|---|---|---|---|---|
| Akses VPN Sahaja | Ya | No | No | DIY |
| Tiada Titik Akhir API Awam | Ya | Public | Public | Ya |
| VPS Disenarai Putih Sahaja | Ya | API key only | API key only | Manual |
| Penyulitan WireGuard | Ya | HTTPS only | HTTPS only | Your setup |
| Data Kekal di Malaysia | Ya | US servers | US/SG | Your choice |
| Sedia Pematuhan PDPA | Built-in | GDPR only | GDPR only | DIY |
| Tiada Latihan pada Data Anda | Guaranteed | Opt-out | May train | Ya |
| Jejak Audit | Full | Terhad | Terhad | DIY |
| Sifar Pengekalan Data | Ya | 30 days | Varies | Ya |
| Pengurusan Berpusat | AINNA manages | OpenAI controls | Google controls | You manage |
Carta keselamatan berlapis yang menunjukkan bagaimana internet awam dikekalkan di luar manakala hanya nod VPS yang ditetapkan boleh mencapai teras vLLM melalui VPN.
Jawapan terus tentang model, keselamatan VPN, onboarding, SLA, dan perbandingan NeuralOps dengan pengehosan sendiri.
Kami menjalankan 7 model berat terbuka yang dioptimumkan untuk kes penggunaan berbeza: Llama 3.1 (8B/70B), Qwen 2.5 (7B/32B/72B), Nemotron 3 Ultra dan Mistral Nemo 12B. Ketersediaan model berbeza mengikut pelan Permulaan mendapat 2 model, Perniagaan mendapat 5, Enterprise mendapat semua 7. Semua model berjalan setempat pada kluster GPU kami; tiada panggilan API luaran.
VPS ditentukan anda menerima konfigurasi WireGuard dengan IP peribadi (10.x.x.x). Hanya trafik yang berasal dari VPS tersebut melalui terowong disulitkan mencapai pelayan vLLM. Tiada IP awam, tiada DNS awam, tiada port terbuka pada pelayan LLM. Pembangun anda SSH ke VPS, menjalankan ejen/aplikasi di sana, dan aplikasi tersebut memanggil titik akhir vLLM peribadi. Internet awam tidak boleh mencapai lapisan inferens langsung.
Sama sekali tidak. Sifar pengekalan data pada pelayan vLLM prom diproses dalam memori dan dibuang serta-merta. Tiada log kandungan prom (hanya metadata: cap masa, kiraan token, model). VPS anda diasingkan pada peringkat hiperpengawas; kakitangan AINNA tidak boleh mengakses fail atau memori anda. Ini adalah kontrak dan seni bina.
Permulaan: 3–4 hari. Perniagaan/Enterprise: 5–7 hari. Termasuk: peruntukan VPS (DC Malaysia), persediaan terowong WireGuard, peruntukan model vLLM, DNS + SSL untuk subdomain aplikasi anda, kunci SSH, pemasangan ejen pemantauan dan panggilan penyerahan 1 jam. Enterprise menambah: jurutera akaun khusus, semakan SLA tersuai dan integrasi gerbang Hermes jika diperlukan.
Permintaan melebihi kuota harian anda mengembalikan respons 429 dengan pengepala retry-after. Tiada caj lebihan had ditetapkan semula pada 00:00 UTC. Pelan Enterprise menyokong had kadar tersuai. Anda boleh memantau penggunaan melalui papan pemuka VPS atau meminta peningkatan had melalui jurutera akaun anda.
Enterprise: 99.9% uptime SLA with financial credits (pro-rata refund for downtime > 0.1%). Perniagaan: best-effort with priority support. Permulaan: community-tier monitoring. Semua tiers include: 24/7 infrastructure monitoring, automated failover for VPS layer, and snapshot-based recovery (RPO < 1 hour, RTO < 30 min).
Pelan Enterprise menyokong deployment model tersuai (GGUF / Safetensors) pada petak GPU khusus memerlukan semakan keselamatan dan masa pendahuluan 2 minggu. Penalaan halus tidak ditawarkan pada vLLM dikongsi; kami mengesyorkan menjalankan kerja penalaan halus pada VPS anda (kami menyediakan tambahan VPS berGPU) dan deploy model penyesuai/gabungan ke petak khusus anda.
Hos sendiri memberi anda kawalan penuh tetapi memerlukan: perolehan GPU (masa pendahuluan H200), kepakaran operasi 24/7, VPN + pengerasan, pengoptimuman model, pemantauan dan audit pematuhan. NeuralOps memindahkan semua operasi infrastruktur anda mendapat lapisan inferens diperkukuh, dipantau dan mematuhi PDPA dalam beberapa hari, bukan bulan. Perbandingan kos: RM3,500/bulan (Enterprise) vs ~RM25K+/bulan untuk tindanan hos sendiri setara (sewa GPU + kolokasi + kejuruteraan). Nota: H200 GPU server lease alone (no colo/engineering) ranges RM20K–RM25K/mo the RM25K+ figure reflects the full managed stack.
Permulaan: E-mel/tiket (respons 48j). Perniagaan: Slack/Teams + tiket (4j waktu perniagaan). Enterprise: Saluran Slack khusus + telefon + tiket (respons 1j) + semakan seni bina suku tahunan. Semua peringkat termasuk akses kepada runbook, dokumen API dan halaman status AINNA.
Semua infrastruktur kluster GPU vLLM pusat dan instans VPS pelanggan dihoskan di pusat data Tier III di Cyberjaya dan Kuala Lumpur, Malaysia. Data tidak pernah keluar dari bidang kuasa Malaysia. Ini memenuhi Seksyen 129 PDPA (sekatan pemindahan rentas sempadan) secara lalai.
Mulakan dengan satu aliran kerja. Bina satu sistem. Skalakan lapisan kecerdasan dari situ.
Enterprise-grade AI infrastructure with VPN-only security. Peribadi API only. Designed for controlled data exposure.
Penyelidikan evidence: Penyelidikan Hub · NeuralOps Seni Bina · Kecekapan token Benchmark
Mulakan
Mula with one workflow, department, or operational problem and scale through NeuralOps.
Basic Package
Special SME traction programme by AINNA.
Every package includes a Basic AI Agent for website governance, content assistance and article management.
View SME Offer →