Hiểu và dùng AI Local · Bài 12

Chi phí thật và bảo mật khi dùng AI Local

AI Local không tốn phí API theo lượt, nhưng không miễn phí: có tiền máy, tiền điện, công vận hành. Và máy chạy model là một máy chủ cần được bảo vệ. Bài viết đưa công thức để bạn tự điền số của mình, các lỗ hổng đã công bố cùng bản vá, cách truy cập từ xa an toàn và một checklist bảo mật. Dữ kiện kiểm tra ngày 07/10/2026.

Cập nhật 07/10/2026⏱ 9 phút đọcKiến thức nềnNgười mới → Trung cấp

Phần mềm miễn phí, nhưng AI Local không miễn phí

Chị Thu bán mỹ phẩm online, nghe nói AI Local "không tốn phí API" nên mua card đồ hoạ mới, cho máy chạy model cả ngày. Rồi nhân viên muốn dùng từ nhà, một người quen mở máy ra Internet cho tiện. Chị chưa tính tiền điện, cũng không biết giờ người lạ trên Internet cũng gọi được vào máy. (Tình huống minh hoạ.)

Hai rủi ro ở đây: chi phí không được tính trước, và máy chạy model bị lộ ra ngoài. Bài này giúp bạn tự tính chi phí bằng số của mình, rồi khoá an toàn chiếc máy đó. Chưa rõ AI Local là gì, đọc trước AI Local là gì.

Năm khoản chi của AI Local

KhoảnCách tínhGhi chú
Phần mềmThường 0 đồngOllama, llama.cpp, Jan, LM Studio miễn phí; Open WebUI có điều khoản thương hiệu khi trên 50 người dùng
MáyGiá máy ÷ số tháng dự kiến dùngMua mới hoặc nâng cấp; lấy báo giá thật tại nơi bạn mua
ĐiệnCông suất (W) × số giờ chạy ÷ 1000 × giá điệnGiá điện theo hoá đơn hoặc biểu giá hiện hành của EVN
Công vận hànhSố giờ công × đơn giá giờ công nội bộCài đặt, cập nhật bản vá, theo dõi, sao lưu
Thuê GPU (nếu không mua)Giá thuê mỗi giờ × số giờChạy 24/7 cả tháng là khoảng 730 giờ (8.760 giờ/năm ÷ 12)

Giá thuê GPU tham khảo trên RunPod (một ví dụ, không phải khuyến nghị), USD mỗi giờ, 10/2026:

CardGói CommunityGói Secure
RTX 40900,340,74
RTX 50900,690,99
L40S0,791,09
A100 80GB PCIe1,191,59
H100 SXM2,693,49

Nguồn: RunPod pricing · Ollama · LM Studio free for work · Open WebUI license · EVN

Công thức tự tính chi phí AI Local

Công thức chi phí AI Local: tiền máy bằng giá máy chia số tháng dự kiến dùng; tiền điện bằng công suất W nhân giờ chạy chia 1000 nhân giá điện; công vận hành bằng giờ công nhân đơn giá nội bộ; thuê GPU chạy 24/7 bằng giá thuê mỗi giờ nhân 730 giờ; so với hoá đơn API bằng số token chia 1 triệu nhân giá mỗi triệu token; biểu đồ minh hoạ chi phí cộng dồn: AI Local bắt đầu cao vì tiền máy trả trước rồi tăng chậm, hoá đơn API bắt đầu từ 0 rồi tăng nhanh, hai đường cắt nhau ở điểm hoà vốn
Hình: Các khoản chi và điểm hoà vốn (minh hoạ, không phải số đo)

Aduca không ghi sẵn giá máy hay giá điện tại Việt Nam vì chúng khác nhau theo nơi mua, theo bậc điện và theo thời điểm. Bạn copy bảng dưới, điền số của chính mình vào phần trong <…>:

Bảng tự tính chi phíCopy rồi điền số của bạn vào phần trong <…>
# 1. Tiền máy mỗi tháng
Tiền máy/tháng = <giá máy> ÷ <số tháng dự kiến dùng>

# 2. Tiền điện mỗi tháng
Số kWh/tháng   = <công suất W> × <giờ chạy mỗi ngày> × <số ngày> ÷ 1000
Tiền điện      = Số kWh/tháng × <giá điện đồng/kWh>

# 3. Công vận hành mỗi tháng
Tiền công      = <số giờ công> × <đơn giá giờ công nội bộ>

# Tổng AI Local mỗi tháng
Local/tháng    = Tiền máy/tháng + Tiền điện + Tiền công

# 4. Nếu thuê GPU thay vì mua máy (chạy 24/7)
Thuê/tháng     = <giá thuê mỗi giờ> × 730

# 5. Hoá đơn API mỗi tháng (để so sánh)
API/tháng      = <token vào> ÷ 1.000.000 × <giá vào> + <token ra> ÷ 1.000.000 × <giá ra>

Ví dụ minh hoạ (ước tính)

Lưu ý khi ước tính: Batch API của Claude giảm 50% cho việc không gấp; model từ Claude 4.7 trở đi (như Sonnet 5.5, không gồm Haiku 4.5) dùng bộ tách token mới, tạo khoảng 30% nhiều token hơn cho cùng văn bản, nên cộng dư.

Nguồn: NVIDIA RTX 5090 · RunPod pricing · Claude pricing

So với hoá đơn API: tìm điểm hoà vốn

Điểm hoà vốn là tháng mà tổng chi phí AI Local cộng dồn bằng hoặc thấp hơn tổng hoá đơn API cộng dồn. Khi mua máy, AI Local tốn nhiều ở tháng đầu rồi tăng chậm; API bắt đầu từ 0 nhưng tăng theo lượng dùng.

  1. Lấy số token mỗi tháng từ trang mức dùng của nhà cung cấp API, tính API/tháng.
  2. Tính Local/tháng theo bảng trên.
  3. Cộng dồn từng tháng cho cả hai bên, tìm tháng hai đường gặp nhau.
Ba lỗi hay gặp: (1) so khác chất lượng, trong khi model local nhỏ có thể cần sửa nhiều hơn và công sửa cũng là chi phí; (2) quên công vận hành; (3) máy không đủ mạnh, rốt cuộc vẫn gửi việc khó lên đám mây. Vì vậy mô hình lai (local cho việc thường ngày, đám mây cho việc khó) thường thực tế hơn. Cách dựng: Dùng AI Local làm bộ não cho AI Agent.

Bảo mật 1: chỉ nghe trên máy, không mở cổng ra Internet

Ollama mặc định chỉ nghe ở 127.0.0.1:11434, tức chỉ chính máy đó gọi được. Đổi biến OLLAMA_HOST sẽ đổi địa chỉ nghe, và có thể mở cho máy khác vào. llama-server mặc định nghe 127.0.0.1:8080.

Vấn đề nằm ở chỗ API của Ollama không có xác thực: khoá API trong lời gọi kiểu OpenAI bị bỏ qua, và bản ghi CVE nêu các endpoint /api/create, /api/push không có xác thực trong bản phát hành gốc. LM Studio mặc định cũng không yêu cầu xác thực; bạn phải tự bật API token. Nghĩa là ai gọi tới được cổng là dùng được model của bạn.

Đây không phải rủi ro lý thuyết: trong bài blog ngày 01/09/2025, Cisco dùng công cụ Shodan và tìm thấy 1.139 máy chủ Ollama lộ ra Internet, kèm khuyến nghị bắt buộc xác thực, phân vùng mạng, tường lửa, giới hạn tần suất và giám sát.

Nguồn: Ollama FAQ · llama-server · Ollama API · CVE-2026-7482 · LM Studio auth · Cisco Blog

Bảo mật 2: lỗ hổng đã công bố và bản vá

Phần mềm chạy model cũng là phần mềm máy chủ, và đã có nhiều lỗ hổng được công bố kèm bản vá:

Phần mềmLỗ hổng đã công bốCách xử lý
OllamaCVE-2026-7482 (CVSS 3.1: 9.1, nghiêm trọng): đọc tràn bộ nhớ khi xử lý file GGUF qua /api/create ở các bản trước 0.17.1; có thể lộ biến môi trường, khoá API, prompt hệ thống, hội thoại của người khácCập nhật lên 0.17.1 trở lên
llama.cppCVE-2026-34159 (9.8): chạy mã từ xa không cần xác thực qua RPC backend, các bản trước b8492 theo bản ghi CVE; CVE-2026-33298 (7.8, vá ở b7824); CVE-2026-27940 (7.8, vá từ b8146)Cập nhật bản mới; không mở RPC backend ra mạng; chỉ tải GGUF từ nguồn tin cậy
vLLMBản 0.31.0 vá loạt cảnh báo, trong đó có lỗi cho phép chạy mã từ xa (8.1) ảnh hưởng từ 0.7.3 đến trước 0.31.0Cập nhật lên 0.31.0 trở lên
Open WebUIBản 0.11.4 vá nhiều cảnh báo, ví dụ lỗi cho trang web bất kỳ lấy cắp token phiên đăng nhập (8.1), ảnh hưởng từ 0.7.0 đến trước 0.11.4Cập nhật lên 0.11.4 trở lên
AnythingLLMCVE-2026-48116 (7.5): chạy mã từ xa qua kỹ năng tìm tệp của agent, ảnh hưởng các bản đến 1.12.1; thêm các cảnh báo 09/2026 đến bản 1.16.1Cập nhật lên 1.17.0

Thói quen nên có: theo dõi trang phát hành và trang cảnh báo bảo mật của từng phần mềm, kiểm tra bản mới mỗi tháng. Ollama trên Linux cập nhật bằng cách chạy lại script cài đặt:

Lệnh trên máy tính của bạnChạy trong Terminal trên máy Linux chạy Ollama; đọc nội dung script trước khi chạy
ollama -v                                      # xem phiên bản đang chạy
curl -fsSL https://ollama.com/install.sh | sh   # Linux: chạy lại script cài để cập nhật

Nguồn: CVE-2026-7482 · Ollama v0.17.1 · llama.cpp advisories · vLLM advisories · Open WebUI advisories · AnythingLLM advisories · Ollama Linux

Bảo mật 3: dùng từ xa qua VPN hoặc reverse proxy có xác thực

Ba lớp bảo mật cho AI Local: máy chạy model chỉ nghe 127.0.0.1; nhân viên ở xa vào qua VPN, ví dụ Tailscale, được phép; ứng dụng đi qua proxy có xác thực token, giới hạn tần suất, ghi nhật ký; mở thẳng cổng 11434 ra Internet bị chặn vì Ollama và LM Studio mặc định không bắt xác thực; luôn cập nhật bản vá, Ollama 0.17.1 trở lên vá CVE-2026-7482, chỉ tải model từ nguồn tin cậy
Hình: Ba lớp bảo mật cho máy chạy model (minh hoạ)
Khoá, token chỉ đặt trong biến môi trường hoặc tệp .env trên máy; không gửi qua chat, không dán vào prompt, không để lộ trong ảnh chụp màn hình.

Nối máy chạy model ở văn phòng với VPS chạy OpenClaw, Hermes hay n8n: Dùng AI Local làm bộ não cho OpenClaw, Hermes, n8n.

Nguồn: What is Tailscale · Tailscale pricing · vLLM security · llama-server · LM Studio auth

Bảo mật 4: dữ liệu, quyền truy cập và sao lưu

Nguồn: Ollama FAQ · Ollama Cloud · Open WebUI · OpenClaw local models · OpenClaw prompt injection

Checklist bảo mật AI Local

Làm gì tiếp theo?

Chọn máy: Cấu hình máy tính chạy AI Local. Đi từ một máy lên cả đội: Lộ trình xây hệ thống AI Local.

Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.

Đọc tiếp: 40 việc AI Local làm được →

Câu hỏi thường gặp

Chạy AI Local tốn bao nhiêu tiền điện?

Tính theo công thức: công suất (W) × số giờ chạy ÷ 1000 × giá điện mỗi kWh. Ví dụ minh hoạ: riêng card RTX 5090 có công suất đồ hoạ 575W, chạy đầy tải 8 giờ mỗi ngày trong 30 ngày là 138 kWh, chưa tính CPU, màn hình, làm mát. Bạn nhân số kWh với giá điện trên hoá đơn của mình.

Nên thuê GPU theo giờ hay mua máy?

Thuê chạy suốt tháng tốn khoảng giá mỗi giờ × 730. Ví dụ minh hoạ theo bảng giá RunPod tháng 10/2026: RTX 4090 gói Community 0,34 USD/giờ, tức khoảng 248 USD/tháng nếu chạy 24/7. Thuê hợp khi cần thử nghiệm hoặc dùng không đều; mua hợp khi dùng đều và lâu dài. Hãy tính cả hai bằng số của bạn.

Khi nào AI Local rẻ hơn dùng API?

Khi tổng chi phí AI Local cộng dồn (máy chia theo tháng, điện, công vận hành) thấp hơn tổng hoá đơn API cộng dồn cho cùng khối lượng việc và cùng chất lượng đầu ra. Lượng dùng càng lớn và đều thì điểm hoà vốn càng sớm; dùng ít thì API có thể rẻ hơn.

Ollama có an toàn không?

Mặc định Ollama chỉ nghe trên chính máy đó (127.0.0.1:11434), nhưng API của nó không có xác thực. Vì vậy đừng mở cổng ra Internet, và cập nhật thường xuyên: lỗ hổng nghiêm trọng CVE-2026-7482 đã được vá từ bản 0.17.1.

Muốn dùng AI Local ở nhà thì có nên mở cổng ra Internet không?

Không nên. Hãy dùng VPN (ví dụ Tailscale) để chỉ thiết bị của bạn vào được mạng riêng, hoặc đặt reverse proxy có token, giới hạn tần suất và ghi nhật ký phía trước. Cisco từng tìm thấy hơn một nghìn máy chủ Ollama lộ ra Internet.

Tài liệu liên quan

Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local – Nguyễn Đức, Aduca
Bước tiếp theo

Đăng ký Tư vấn 1-1 về AI Local

Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.

Về AducaChuỗi bài do đội ngũ Aduca biên soạn từ kinh nghiệm đào tạo và triển khai AI Agent cho Marketing – Sales. Aduca Academy do Nguyễn Đức – Chủ tịch Aduca Group sáng lập; ông kinh doanh thương mại điện tử từ 2012, chạy quảng cáo Facebook từ 2014 và đào tạo từ 2016. Phần thực hành từng bước nằm trong các thư mục OpenClaw, Hermes Agent, Claude, ChatGPT và n8n.

Nguồn tham khảo

Lịch sử cập nhật

Miễn trừ trách nhiệm

Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.