Lộ trình xây hệ thống AI Local cho doanh nghiệp: từ một máy đến cả đội
Đi từ một máy cá nhân đến cả đội cùng dùng AI chạy trên máy của doanh nghiệp: việc cần làm ở từng giai đoạn, khi nào mua máy hay thuê GPU, ai phụ trách, cách kiểm thử chất lượng bằng câu hỏi thật, sao lưu, bảo mật và những rủi ro hay gặp, theo dữ kiện kiểm tra ngày 07/10/2026.
Một người dùng tốt, cả công ty dùng thì sao?
Bạn trưởng nhóm marketing chạy Ollama trên laptop ba tuần, viết nháp nhanh hơn hẳn và không lo lộ dữ liệu. Giám đốc muốn cả đội mười lăm người cùng dùng. Lập tức có câu hỏi: mua máy gì, ai cài và cập nhật, dữ liệu khách có an toàn không, làm sao biết model trả lời đủ tốt. (Tình huống minh hoạ.)
Lộ trình ba giai đoạn dưới đây trả lời lần lượt từng câu.
Hệ thống AI Local cho doanh nghiệp là gì?
Hệ thống AI Local cho doanh nghiệp là máy chạy model, phần mềm phục vụ model, giao diện cho người dùng, kho kiến thức, quy tắc bảo mật và người phụ trách, được mở rộng từng giai đoạn khi việc thật chứng minh giá trị.
- Giai đoạn 1Một máy cá nhân, thử 3–5 việc
- Giai đoạn 2Máy chung, Open WebUI, cả nhóm dùng
- Giai đoạn 3Máy chủ GPU, router local và cloud, Agent
Giai đoạn 1: một máy cá nhân, chứng minh giá trị
- Mục tiêu: chọn 3–5 việc trong 40 việc AI Local làm được, chạy trên máy sẵn có, xem việc nào đạt chất lượng.
- Công cụ: Ollama (MIT, miễn phí) hoặc LM Studio (miễn phí cả khi dùng cho công việc từ 08/07/2025). Cài theo hướng dẫn cài AI Local; chọn model vừa máy theo cấu hình máy và bản đồ model mở.
- Dữ liệu: model chạy local thì dữ liệu ở lại máy. Model có đuôi
-cloudcủa Ollama xử lý trên máy chủ của họ; đặtOLLAMA_NO_CLOUD=1nếu muốn chặn hẳn. - Đầu ra: bộ câu hỏi thật, bảng chấm điểm (mục kiểm thử bên dưới), danh sách việc đạt và không đạt.
- Điều kiện sang giai đoạn 2: ít nhất hai việc đạt ngưỡng, có vài người khác thật sự muốn dùng.
Nguồn: Ollama FAQ · Ollama Cloud · LM Studio free for work
Giai đoạn 2: máy chung cho nhóm, Open WebUI làm cửa vào
Một máy mạnh hơn đặt ở văn phòng chạy Ollama; Open WebUI là giao diện chat trên trình duyệt cho cả nhóm. Tài khoản đầu tiên tạo ra thành quản trị; đăng ký mới mặc định tắt đến khi quản trị bật. Mỗi người một tài khoản; model riêng (prompt hệ thống, kho kiến thức gắn sẵn) và mẫu câu lệnh dùng chung đặt trong Workspace.
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data -e WEBUI_SECRET_KEY=<khoá bí mật> \
--name open-webui --restart always ghcr.io/open-webui/open-webui:main- Mạng: Ollama mặc định chỉ nghe
127.0.0.1:11434. Open WebUI chạy Docker trên cùng máy gọi Ollama quahost.docker.internal:11434. Nếu không kết nối được do Ollama chỉ nghe 127.0.0.1, tài liệu Open WebUI gợi ý chạy container với--network=hosthoặc đổiOLLAMA_HOST; khi đổi thì chặn cổng 11434 bằng tường lửa, không để lộ ra ngoài. Người dùng vào Open WebUI (cổng 3000) trong mạng nội bộ; làm việc từ xa thì qua VPN như Tailscale (gói Personal miễn phí, tối đa 6 người dùng), không mở cổng ra Internet. - Nhiều người cùng hỏi:
OLLAMA_NUM_PARALLELmặc định là 1, yêu cầu đến sau phải chờ. Tăng số này thì bộ nhớ cho context (KV cache) tăng theo số người dùng song song. - Kho kiến thức: Ollama mặc định cấp context 4k khi VRAM dưới 24GiB, dữ liệu truy xuất có thể bị bỏ qua; Open WebUI khuyên tăng lên từ 8.192.
- Giấy phép Open WebUI: từ v0.6.6 có điều khoản giữ thương hiệu; muốn xoá hay đổi chữ "Open WebUI" thì phải có tối đa 50 người dùng trong 30 ngày, giấy phép doanh nghiệp hoặc văn bản cho phép.
Nguồn: Open WebUI quick start · Open WebUI Models · Knowledge · Open WebUI RAG · Open WebUI license · Ollama FAQ · Open WebUI – lỗi kết nối Ollama · Ollama context length · NVIDIA – KV cache · Tailscale · Tailscale pricing
Giai đoạn 3: máy chủ GPU, nhiều người, router và Agent
- Người dùng, AgentOpen WebUI, OpenClaw, Hermes, n8n
- RouterLiteLLM: chọn model, ngân sách, ghi log
- Model localvLLM hoặc Ollama trên máy chủ GPU
- Cloud dự phòngClaude, ChatGPT cho câu khó
- Phục vụ nhiều người: vLLM chạy trên Linux có GPU, hợp nhiều người hoặc nhiều Agent gọi cùng lúc; không dành cho người mới. Lưu ý
--api-keycủa vLLM chỉ bảo vệ endpoint dưới/v1,/v2,/inference; tài liệu khuyên đặt sau reverse proxy chỉ cho phép endpoint cần thiết. - Router local và cloud: LiteLLM (MIT, trừ thư mục enterprise) cho đặt model local làm chính, model cloud làm dự phòng (fallbacks), đặt ngân sách
max_budgettheo team, user, key. OpenClaw có sẵn chế độmodels.mode: "merge"giữ model cloud làm dự phòng. - Agent: OpenClaw, Hermes, n8n dùng model local làm bộ não (Dùng AI Local làm bộ não). Hermes cần context từ 64.000 token; OpenClaw khuyên không dùng model nhỏ cho Agent có công cụ hoặc hộp thư không tin cậy; n8n có bước người duyệt trước khi chạy công cụ nhạy cảm.
Nguồn: vLLM installation · vLLM security · LiteLLM · LiteLLM fallbacks · LiteLLM budgets · OpenClaw local models · Hermes providers · n8n Human-in-the-loop
Mua máy, thuê GPU hay dùng API đám mây?
| Lựa chọn | Hợp khi | Chi phí cần tính |
|---|---|---|
| Máy sẵn có | Giai đoạn 1, thử việc | Thời gian cài, thử |
| Mua máy (Mac bộ nhớ lớn, PC card NVIDIA, máy chủ) | Dùng đều mỗi ngày, dữ liệu nhạy cảm | Giá máy ÷ số tháng dùng + tiền điện + giờ vận hành |
| Thuê GPU theo giờ | Thử model lớn, làm video, việc theo đợt | Giá giờ × số giờ; chạy 24/7 ≈ giá giờ × 730 |
| API đám mây | Việc khó, lượng dùng thấp hoặc thất thường | Token vào, ra × đơn giá của hãng |
(Ví dụ minh hoạ) Thuê một RTX 4090 trên RunPod giá Community $0,34/giờ, chạy 24/7: 0,34 × 730 ≈ $248/tháng; giá Secure $0,74/giờ ≈ $540/tháng. Phía API, Anthropic nêu ví dụ 10.000 phiếu hỗ trợ, trung bình khoảng 3.700 token mỗi hội thoại, chạy Claude Haiku 4.5 hết khoảng $37. Giá tại 10/2026, thay đổi liên tục. Tiền điện = công suất (W) × số giờ ÷ 1000 × giá điện. So sánh chỉ có nghĩa khi cùng chất lượng đầu ra: model nhỏ có thể cần sửa nhiều lần hơn. Nguyên tắc: mua máy sau khi giai đoạn 1 chứng minh việc, thuê GPU để thử trước model lớn. Chi tiết công thức: Chi phí thật và bảo mật.
Nguồn: RunPod pricing · Claude pricing
Ai phụ trách hệ thống?
| Vai trò | Việc chính |
|---|---|
| Chủ doanh nghiệp | Chọn việc ưu tiên, duyệt ngân sách, quy định dữ liệu nào được đưa vào AI, việc nào được dùng cloud |
| Người phụ trách kỹ thuật (nội bộ hoặc thuê ngoài) | Cài đặt, cập nhật bản vá, sao lưu, phân quyền, theo dõi máy |
| Người phụ trách chất lượng | Giữ bộ câu hỏi thật, chấm điểm, sửa prompt và kho kiến thức |
| Người dùng | Dùng đúng quy tắc, báo câu trả lời sai để bổ sung vào bộ kiểm thử |
Doanh nghiệp nhỏ thường một người kiêm nhiều vai. Điều cần tránh là hệ thống chỉ một người hiểu: ghi lại cấu hình, tên model và phiên bản.
Quy trình kiểm thử chất lượng bằng bộ câu hỏi thật
Chưa có bảng xếp hạng tiếng Việt chính thức cho các model mở, nên cách đáng tin là tự đo trên việc thật.
- Gom câu hỏi thật: 20–30 mục cho mỗi việc (tin khách hỏi giá, bài cần viết, tài liệu cần tóm tắt), kèm đáp án chuẩn do người giỏi nhất soạn. Ẩn tên, số điện thoại khách.
- Chạy 2–3 model vừa máy với cùng prompt; ghi tên model, tag, phần mềm và phiên bản.
- Chấm 0–2 theo bốn tiêu chí: đúng dữ kiện, đúng giọng, đúng định dạng, an toàn (không bịa giá, không hứa hẹn). Hai người chấm độc lập, lệch nhiều thì bàn lại.
- Đặt ngưỡng trước khi chấm, ví dụ không câu nào 0 điểm ở "đúng dữ kiện" và "an toàn".
- Chạy lại khi đổi model, cập nhật phần mềm, sửa prompt hoặc kho kiến thức; thêm câu mới từ lỗi người dùng báo.
Bảng chấm AI Local (mẫu)
Ngày: <ngày> | Việc: <tên việc> | Model: <tên:tag> | Phần mềm: <Ollama/LM Studio + phiên bản>
Câu | Câu hỏi thật | Đúng dữ kiện | Đúng giọng | Đúng định dạng | An toàn | Ghi chú
1 | <câu hỏi> | 0-2 | 0-2 | 0-2 | 0-2 |
2 | <câu hỏi> | 0-2 | 0-2 | 0-2 | 0-2 |
Ngưỡng đạt: <ví dụ: không câu nào 0 điểm ở Đúng dữ kiện và An toàn>
Người chấm: <2 người chấm độc lập>Sao lưu, bảo mật và cập nhật
- Không mở cổng phần mềm chạy model (Ollama 11434, LM Studio 1234) ra Internet. API Ollama không có xác thực; Cisco (blog 01/09/2025) tìm thấy 1.139 máy chủ Ollama lộ ra Internet.
- Truy cập từ xa qua VPN hoặc reverse proxy có xác thực; LM Studio bật API token (mặc định tắt).
- Cập nhật bản vá: lỗi CVE-2026-7482 của Ollama (CVSS 3.1: 9.1) có thể làm lộ biến môi trường, khoá API, hội thoại, đã vá ở v0.17.1; Open WebUI v0.11.4 vá nhiều lỗi; AnythingLLM có advisory ảnh hưởng đến 1.16.1.
- Chỉ tải model, file GGUF từ nguồn tin cậy (llama.cpp từng có lỗi khi đọc file GGUF).
- Khoá bí mật (WEBUI_SECRET_KEY, khoá API cloud) để trong tệp .env hoặc biến môi trường; không gửi qua chat, không dán vào prompt.
- Sao lưu volume dữ liệu Open WebUI (lịch sử chat), Modelfile, preset, cấu hình router, bộ câu hỏi và bảng chấm. File model tải lại được, chỉ cần ghi tên và tag.
- Đưa vào AI lượng dữ liệu khách tối thiểu cần dùng; ẩn danh khi có thể.
Checklist đầy đủ: Chi phí thật và bảo mật khi dùng AI Local.
Nguồn: Cisco · LM Studio authentication · CVE-2026-7482 · Ollama v0.17.1 · Open WebUI advisories · AnythingLLM advisories · llama.cpp advisories · Open WebUI quick start
Rủi ro thường gặp và cách tránh
| Rủi ro | Cách tránh |
|---|---|
| Mua máy đắt trước khi biết việc | Làm giai đoạn 1 trên máy sẵn có; thuê GPU thử model lớn |
| Kho kiến thức trả lời như không đọc tài liệu | Tăng context (mặc định 4k khi VRAM dưới 24GiB) |
| Model nhỏ bịa giá, làm theo câu lạ trong tin nhắn | Kho kiến thức, người duyệt, model lớn hơn hoặc cloud cho kênh khách |
| Nhiều người dùng một máy bị chậm | Tăng song song có tính bộ nhớ; sang vLLM ở giai đoạn 3 |
| Dữ liệu rời máy mà không biết | Chặn model -cloud, quy định việc nào được dùng cloud |
| Dùng model ảnh, giọng phi thương mại cho quảng cáo | Kiểm tra giấy phép trước (bảng ở bài 40 việc) |
| Hệ thống phụ thuộc một người | Ghi lại cấu hình, sao lưu, ít nhất hai người biết vận hành |
Bắt đầu từ đâu?
- Tuần này: chọn 3 việc trong 40 việc AI Local làm được, cài Ollama hoặc LM Studio trên một máy sẵn có.
- Hai tuần tới: soạn bộ câu hỏi thật, chạy 2–3 model, chấm điểm theo mẫu ở trên.
- Khi có ít nhất hai việc đạt: lên kế hoạch máy chung và Open WebUI cho nhóm, cử người phụ trách kỹ thuật và chất lượng.
Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn. Dịch vụ cài AI Local nằm trong gói.
Câu hỏi thường gặp
Doanh nghiệp nhỏ có cần đi đủ ba giai đoạn không?
Không. Nhiều doanh nghiệp dừng ở giai đoạn 1 hoặc 2 là đủ: vài người dùng chung một máy có Open WebUI, việc khó vẫn dùng Claude hoặc ChatGPT. Giai đoạn 3 chỉ cần khi có nhiều người hoặc nhiều Agent gọi model cùng lúc, chạy 24/7.
Máy chung ở giai đoạn 2 cần cấu hình thế nào?
Tuỳ model mà bộ câu hỏi thật cho thấy là đạt. Model chữ lớn cỡ 26–35B có file khoảng 16–24GB, cần Mac 24–36GB hoặc card 24–32GB VRAM (ước tính). Nhiều người dùng song song và context dài làm bộ nhớ cần thêm. Xem bảng mức máy trong bài 40 việc AI Local và bài cấu hình máy.
Có nên bỏ hẳn Claude, ChatGPT khi đã có AI Local?
Không nên. Model mở chạy được trên máy phổ thông thường chưa bằng model lớn nhất trên đám mây ở việc khó. Cách thực tế là kết hợp: việc thường ngày và dữ liệu nhạy cảm chạy local, việc khó hoặc dự phòng dùng đám mây qua router có hạn mức chi tiêu.
Bao lâu nên kiểm thử lại chất lượng?
Mỗi khi đổi model, cập nhật phần mềm chạy model, sửa prompt hệ thống hoặc kho kiến thức. Ngoài ra nên chạy lại bộ câu hỏi thật định kỳ, ví dụ mỗi tháng, và thêm câu mới từ các lỗi người dùng báo.
Aduca có hỗ trợ cài đặt AI Local không?
Có, qua Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp: Aduca cùng bạn chọn việc, chọn máy, lộ trình; dịch vụ cài AI Local nằm trong gói, chi phí báo sau buổi tư vấn.
Tài liệu liên quan
- AI Local · AI AgentAI Local là gì? Chạy AI ngay trên máy tính, không tốn phí APIAI Local là gì: chạy model AI mở ngay trên máy tính của bạn, không trả phí API theo lượt, dữ liệu ở lại máy. Lợi ích, giới hạn, so sánh với AI đám mây.
- AI Local · AI AgentCấu hình máy tính chạy AI Local: RAM, VRAM, Mac hay PC NVIDIACấu hình máy tính chạy AI Local: RAM, VRAM quyết định model nào chạy được, cách ước tính dung lượng theo Q4/Q8, Mac hay PC NVIDIA, ổ cứng, mua máy hay thuê GPU.
- AI Local · AI AgentBản đồ model AI mở 2026: chọn model theo việc và theo máyBản đồ model AI mở 2026: Qwen, Gemma 4, gpt-oss, Llama 4, Mistral, GLM, DeepSeek, Phi; cỡ, MoE hay dense, giấy phép thương mại, tag Ollama, tự thử tiếng Việt.
- AI Local · AI AgentCài AI Local trong 30 phút: Ollama, LM Studio và Open WebUICài AI Local từng bước trên Windows, macOS, Linux: chọn Ollama, LM Studio, Jan hay llama.cpp, chạy thử model nhỏ, đặt context, dựng Open WebUI cho nhóm.
Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local
Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.
Nguồn tham khảo
- Open WebUI Docs – Quick start
- Open WebUI Docs – Giấy phép
- Ollama Docs – FAQ (địa chỉ nghe, chạy song song, dữ liệu)
- vLLM Docs – Security
- LiteLLM Docs – Fallbacks
- LiteLLM Docs – Ngân sách theo team, user, key
- RunPod – Bảng giá thuê GPU
- CVE-2026-7482 (Ollama)
- Cisco – Máy chủ Ollama lộ ra Internet
- Hermes Agent Docs – Providers (context cho Agent)
Lịch sử cập nhật
- 07/10/2026 — Bản đầu.
Miễn trừ trách nhiệm
Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.