Hiểu và dùng AI Local · Bài 14

Lộ trình xây hệ thống AI Local cho doanh nghiệp: từ một máy đến cả đội

Đi từ một máy cá nhân đến cả đội cùng dùng AI chạy trên máy của doanh nghiệp: việc cần làm ở từng giai đoạn, khi nào mua máy hay thuê GPU, ai phụ trách, cách kiểm thử chất lượng bằng câu hỏi thật, sao lưu, bảo mật và những rủi ro hay gặp, theo dữ kiện kiểm tra ngày 07/10/2026.

Cập nhật 07/10/2026⏱ 9 phút đọcKiến thức nềnTrung cấp → Nâng cao

Một người dùng tốt, cả công ty dùng thì sao?

Bạn trưởng nhóm marketing chạy Ollama trên laptop ba tuần, viết nháp nhanh hơn hẳn và không lo lộ dữ liệu. Giám đốc muốn cả đội mười lăm người cùng dùng. Lập tức có câu hỏi: mua máy gì, ai cài và cập nhật, dữ liệu khách có an toàn không, làm sao biết model trả lời đủ tốt. (Tình huống minh hoạ.)

Lộ trình ba giai đoạn dưới đây trả lời lần lượt từng câu.

Hệ thống AI Local cho doanh nghiệp là gì?

Hệ thống AI Local cho doanh nghiệp là máy chạy model, phần mềm phục vụ model, giao diện cho người dùng, kho kiến thức, quy tắc bảo mật và người phụ trách, được mở rộng từng giai đoạn khi việc thật chứng minh giá trị.

Lộ trình xây hệ thống AI Local ba giai đoạn: giai đoạn 1 một máy cá nhân chạy Ollama hoặc LM Studio; giai đoạn 2 máy chung cho nhóm với Open WebUI trong mạng nội bộ, nhiều người dùng; giai đoạn 3 máy chủ GPU cho nhiều người, router local và cloud, AI Agent
Hình: Ba giai đoạn, chứng minh giá trị trên một máy rồi mới mở rộng (minh hoạ)
  1. Giai đoạn 1Một máy cá nhân, thử 3–5 việc
  2. Giai đoạn 2Máy chung, Open WebUI, cả nhóm dùng
  3. Giai đoạn 3Máy chủ GPU, router local và cloud, Agent
Chỉ sang giai đoạn sau khi giai đoạn trước đạt điều kiện

Giai đoạn 1: một máy cá nhân, chứng minh giá trị

Nguồn: Ollama FAQ · Ollama Cloud · LM Studio free for work

Giai đoạn 2: máy chung cho nhóm, Open WebUI làm cửa vào

Một máy mạnh hơn đặt ở văn phòng chạy Ollama; Open WebUI là giao diện chat trên trình duyệt cho cả nhóm. Tài khoản đầu tiên tạo ra thành quản trị; đăng ký mới mặc định tắt đến khi quản trị bật. Mỗi người một tài khoản; model riêng (prompt hệ thống, kho kiến thức gắn sẵn) và mẫu câu lệnh dùng chung đặt trong Workspace.

Lệnh trên máy tính của bạnChạy trên máy chung có Docker; tạo khoá bằng openssl rand -hex 32, không gửi khoá qua chat
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data -e WEBUI_SECRET_KEY=<khoá bí mật> \
  --name open-webui --restart always ghcr.io/open-webui/open-webui:main

Nguồn: Open WebUI quick start · Open WebUI Models · Knowledge · Open WebUI RAG · Open WebUI license · Ollama FAQ · Open WebUI – lỗi kết nối Ollama · Ollama context length · NVIDIA – KV cache · Tailscale · Tailscale pricing

Giai đoạn 3: máy chủ GPU, nhiều người, router và Agent

  1. Người dùng, AgentOpen WebUI, OpenClaw, Hermes, n8n
  2. RouterLiteLLM: chọn model, ngân sách, ghi log
  3. Model localvLLM hoặc Ollama trên máy chủ GPU
  4. Cloud dự phòngClaude, ChatGPT cho câu khó
Luồng yêu cầu ở giai đoạn 3 (ví dụ minh hoạ)

Nguồn: vLLM installation · vLLM security · LiteLLM · LiteLLM fallbacks · LiteLLM budgets · OpenClaw local models · Hermes providers · n8n Human-in-the-loop

Mua máy, thuê GPU hay dùng API đám mây?

Lựa chọnHợp khiChi phí cần tính
Máy sẵn cóGiai đoạn 1, thử việcThời gian cài, thử
Mua máy (Mac bộ nhớ lớn, PC card NVIDIA, máy chủ)Dùng đều mỗi ngày, dữ liệu nhạy cảmGiá máy ÷ số tháng dùng + tiền điện + giờ vận hành
Thuê GPU theo giờThử model lớn, làm video, việc theo đợtGiá giờ × số giờ; chạy 24/7 ≈ giá giờ × 730
API đám mâyViệc khó, lượng dùng thấp hoặc thất thườngToken vào, ra × đơn giá của hãng

(Ví dụ minh hoạ) Thuê một RTX 4090 trên RunPod giá Community $0,34/giờ, chạy 24/7: 0,34 × 730 ≈ $248/tháng; giá Secure $0,74/giờ ≈ $540/tháng. Phía API, Anthropic nêu ví dụ 10.000 phiếu hỗ trợ, trung bình khoảng 3.700 token mỗi hội thoại, chạy Claude Haiku 4.5 hết khoảng $37. Giá tại 10/2026, thay đổi liên tục. Tiền điện = công suất (W) × số giờ ÷ 1000 × giá điện. So sánh chỉ có nghĩa khi cùng chất lượng đầu ra: model nhỏ có thể cần sửa nhiều lần hơn. Nguyên tắc: mua máy sau khi giai đoạn 1 chứng minh việc, thuê GPU để thử trước model lớn. Chi tiết công thức: Chi phí thật và bảo mật.

Nguồn: RunPod pricing · Claude pricing

Ai phụ trách hệ thống?

Vai tròViệc chính
Chủ doanh nghiệpChọn việc ưu tiên, duyệt ngân sách, quy định dữ liệu nào được đưa vào AI, việc nào được dùng cloud
Người phụ trách kỹ thuật (nội bộ hoặc thuê ngoài)Cài đặt, cập nhật bản vá, sao lưu, phân quyền, theo dõi máy
Người phụ trách chất lượngGiữ bộ câu hỏi thật, chấm điểm, sửa prompt và kho kiến thức
Người dùngDùng đúng quy tắc, báo câu trả lời sai để bổ sung vào bộ kiểm thử

Doanh nghiệp nhỏ thường một người kiêm nhiều vai. Điều cần tránh là hệ thống chỉ một người hiểu: ghi lại cấu hình, tên model và phiên bản.

Quy trình kiểm thử chất lượng bằng bộ câu hỏi thật

Chưa có bảng xếp hạng tiếng Việt chính thức cho các model mở, nên cách đáng tin là tự đo trên việc thật.

Quy trình kiểm thử chất lượng AI Local: bộ câu hỏi thật của doanh nghiệp, chạy 2 đến 3 model cùng câu hỏi, chấm điểm nội bộ thang 0 đến 2 theo đúng dữ kiện, đúng giọng, đúng định dạng, an toàn, chọn model và ghi lại phiên bản, prompt, điểm, thử lại sau mỗi cập nhật
Hình: Năm bước kiểm thử, lặp lại sau mỗi lần cập nhật (minh hoạ)
  1. Gom câu hỏi thật: 20–30 mục cho mỗi việc (tin khách hỏi giá, bài cần viết, tài liệu cần tóm tắt), kèm đáp án chuẩn do người giỏi nhất soạn. Ẩn tên, số điện thoại khách.
  2. Chạy 2–3 model vừa máy với cùng prompt; ghi tên model, tag, phần mềm và phiên bản.
  3. Chấm 0–2 theo bốn tiêu chí: đúng dữ kiện, đúng giọng, đúng định dạng, an toàn (không bịa giá, không hứa hẹn). Hai người chấm độc lập, lệch nhiều thì bàn lại.
  4. Đặt ngưỡng trước khi chấm, ví dụ không câu nào 0 điểm ở "đúng dữ kiện" và "an toàn".
  5. Chạy lại khi đổi model, cập nhật phần mềm, sửa prompt hoặc kho kiến thức; thêm câu mới từ lỗi người dùng báo.
Mẫu bảng chấmCopy vào bảng tính; thay phần trong <…>
Bảng chấm AI Local (mẫu)
Ngày: <ngày> | Việc: <tên việc> | Model: <tên:tag> | Phần mềm: <Ollama/LM Studio + phiên bản>
Câu | Câu hỏi thật | Đúng dữ kiện | Đúng giọng | Đúng định dạng | An toàn | Ghi chú
1   | <câu hỏi>  | 0-2          | 0-2        | 0-2            | 0-2     |
2   | <câu hỏi>  | 0-2          | 0-2        | 0-2            | 0-2     |
Ngưỡng đạt: <ví dụ: không câu nào 0 điểm ở Đúng dữ kiện và An toàn>
Người chấm: <2 người chấm độc lập>

Sao lưu, bảo mật và cập nhật

Checklist đầy đủ: Chi phí thật và bảo mật khi dùng AI Local.

Nguồn: Cisco · LM Studio authentication · CVE-2026-7482 · Ollama v0.17.1 · Open WebUI advisories · AnythingLLM advisories · llama.cpp advisories · Open WebUI quick start

Rủi ro thường gặp và cách tránh

Rủi roCách tránh
Mua máy đắt trước khi biết việcLàm giai đoạn 1 trên máy sẵn có; thuê GPU thử model lớn
Kho kiến thức trả lời như không đọc tài liệuTăng context (mặc định 4k khi VRAM dưới 24GiB)
Model nhỏ bịa giá, làm theo câu lạ trong tin nhắnKho kiến thức, người duyệt, model lớn hơn hoặc cloud cho kênh khách
Nhiều người dùng một máy bị chậmTăng song song có tính bộ nhớ; sang vLLM ở giai đoạn 3
Dữ liệu rời máy mà không biếtChặn model -cloud, quy định việc nào được dùng cloud
Dùng model ảnh, giọng phi thương mại cho quảng cáoKiểm tra giấy phép trước (bảng ở bài 40 việc)
Hệ thống phụ thuộc một ngườiGhi lại cấu hình, sao lưu, ít nhất hai người biết vận hành

Bắt đầu từ đâu?

  1. Tuần này: chọn 3 việc trong 40 việc AI Local làm được, cài Ollama hoặc LM Studio trên một máy sẵn có.
  2. Hai tuần tới: soạn bộ câu hỏi thật, chạy 2–3 model, chấm điểm theo mẫu ở trên.
  3. Khi có ít nhất hai việc đạt: lên kế hoạch máy chung và Open WebUI cho nhóm, cử người phụ trách kỹ thuật và chất lượng.

Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn. Dịch vụ cài AI Local nằm trong gói.

Câu hỏi thường gặp

Doanh nghiệp nhỏ có cần đi đủ ba giai đoạn không?

Không. Nhiều doanh nghiệp dừng ở giai đoạn 1 hoặc 2 là đủ: vài người dùng chung một máy có Open WebUI, việc khó vẫn dùng Claude hoặc ChatGPT. Giai đoạn 3 chỉ cần khi có nhiều người hoặc nhiều Agent gọi model cùng lúc, chạy 24/7.

Máy chung ở giai đoạn 2 cần cấu hình thế nào?

Tuỳ model mà bộ câu hỏi thật cho thấy là đạt. Model chữ lớn cỡ 26–35B có file khoảng 16–24GB, cần Mac 24–36GB hoặc card 24–32GB VRAM (ước tính). Nhiều người dùng song song và context dài làm bộ nhớ cần thêm. Xem bảng mức máy trong bài 40 việc AI Local và bài cấu hình máy.

Có nên bỏ hẳn Claude, ChatGPT khi đã có AI Local?

Không nên. Model mở chạy được trên máy phổ thông thường chưa bằng model lớn nhất trên đám mây ở việc khó. Cách thực tế là kết hợp: việc thường ngày và dữ liệu nhạy cảm chạy local, việc khó hoặc dự phòng dùng đám mây qua router có hạn mức chi tiêu.

Bao lâu nên kiểm thử lại chất lượng?

Mỗi khi đổi model, cập nhật phần mềm chạy model, sửa prompt hệ thống hoặc kho kiến thức. Ngoài ra nên chạy lại bộ câu hỏi thật định kỳ, ví dụ mỗi tháng, và thêm câu mới từ các lỗi người dùng báo.

Aduca có hỗ trợ cài đặt AI Local không?

Có, qua Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp: Aduca cùng bạn chọn việc, chọn máy, lộ trình; dịch vụ cài AI Local nằm trong gói, chi phí báo sau buổi tư vấn.

Tài liệu liên quan

Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local – Nguyễn Đức, Aduca
Bước tiếp theo

Đăng ký Tư vấn 1-1 về AI Local

Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.

Về AducaChuỗi bài do đội ngũ Aduca biên soạn từ kinh nghiệm đào tạo và triển khai AI Agent cho Marketing – Sales. Aduca Academy do Nguyễn Đức – Chủ tịch Aduca Group sáng lập; ông kinh doanh thương mại điện tử từ 2012, chạy quảng cáo Facebook từ 2014 và đào tạo từ 2016. Phần thực hành từng bước nằm trong các thư mục OpenClaw, Hermes Agent, Claude, ChatGPT và n8n.

Nguồn tham khảo

Lịch sử cập nhật

Miễn trừ trách nhiệm

Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.