Dùng AI Local làm bộ não cho OpenClaw, Hermes, n8n
Model chạy trên máy của bạn có thể làm bộ não cho AI Agent, giúp giảm hoá đơn API và giữ dữ liệu nội bộ trong nhà. Nhưng mỗi công cụ nối theo một cách riêng, và model nhỏ có giới hạn thật khi gọi công cụ. Bài viết tổng hợp từ tài liệu chính thức của Ollama, LM Studio, OpenClaw, Hermes Agent, n8n, LiteLLM và Tailscale, kiểm tra ngày 07/10/2026.
Hoá đơn API tăng, dữ liệu nội bộ lại nhạy cảm
Đội của bạn đã có AI Agent chạy trên VPS và một workflow n8n phân loại đơn hàng. Hoá đơn API tăng dần, trong khi nhiều việc chỉ là đọc và tóm tắt tài liệu nội bộ mà bạn không muốn gửi ra ngoài. Bạn có một máy có GPU ở văn phòng và tự hỏi: cho Agent dùng model trên máy đó được không? (Tình huống minh hoạ.)
Được, nếu nối đúng cách và biết giới hạn. Bài dành cho người đã cài AI Local (Cài AI Local) và đã dùng một công cụ AI Agent.
AI Local làm bộ não cho AI Agent là gì?
Dùng AI Local làm bộ não cho AI Agent là trỏ Agent (OpenClaw, Hermes, n8n) tới địa chỉ API của phần mềm chạy model trên máy bạn, thay cho API đám mây, để Agent suy nghĩ bằng model mở mà không trả phí theo lượt.
Model là bộ não; trí nhớ, công cụ, kênh chat và lịch làm việc vẫn do OpenClaw, Hermes hay n8n đảm nhận. Đổi bộ não ảnh hưởng trực tiếp tới chất lượng suy luận và độ tin cậy khi gọi công cụ.
Endpoint tương thích OpenAI: địa chỉ mặc định của từng công cụ
Hầu hết phần mềm chạy model mở một endpoint tương thích OpenAI: một địa chỉ API nói cùng "ngôn ngữ" với API của OpenAI. Nhiều phần mềm viết cho OpenAI chỉ cần đổi base URL là gọi được model local.
| Công cụ | Địa chỉ mặc định | Xác thực |
|---|---|---|
| Ollama | http://localhost:11434/v1 (thêm /v1/messages kiểu Anthropic) | Không có; khoá API "bắt buộc nhưng bị bỏ qua" |
| LM Studio | http://localhost:1234/v1 | Mặc định tắt; bật API token được |
| llama.cpp (llama-server) | http://127.0.0.1:8080/v1 | --api-key tuỳ chọn |
| Jan | localhost:1337 | Xem tài liệu Jan |
| vLLM (máy chủ nhiều người dùng) | cổng 8000, /v1 | --api-key, chỉ bảo vệ một số đường dẫn |
Lưu ý từ tài liệu Ollama: đây chỉ là một phần của API OpenAI; chưa hỗ trợ tool_choice, logprobs. Độ dài context cũng không đặt được qua API này, phải đặt ở phía máy chủ Ollama (tài liệu Hermes).
Nguồn: Ollama – OpenAI compatibility · LM Studio – OpenAI compat · LM Studio – xác thực · llama-server · Jan · vLLM – bảo mật
OpenClaw: dùng model local theo tài liệu chính thức
- Chạy
openclaw onboard, chọn Ollama, rồi chọn chế độ: Local only (chỉ model trên máy) hoặc Cloud + Local. - Đặt model chính cho Agent, ví dụ
openclaw models set ollama/gemma4(Gemma 4, Apache-2.0). - Nếu khai báo tay, địa chỉ Ollama là
baseUrl: "http://host:11434", không thêm /v1.
/v1 tương thích OpenAI với Ollama sẽ làm hỏng việc gọi công cụ. Với LM Studio thì ngược lại: baseUrl: "http://127.0.0.1:1234/v1", api: "openai-responses"; máy chủ tương thích OpenAI khác dùng api: "openai-completions".- Cách OpenClaw khuyến nghị chính là plugin llama.cpp kèm
openclaw onboard, chọn Managed local server: OpenClaw kiểm tra RAM, GPU, ổ đĩa trước khi tải. Các công thức dựng sẵn dùng context 64K; công thức nhỏ nhất cần từ 8 GiB bộ nhớ máy (mức sàn, không bảo đảm chạy tốt). - Khai báo nhà cung cấp tự định nghĩa mà bỏ trống
contextWindow, OpenClaw không dò được thì dùng mức dự phòng 200000; hãy ghi đúng con số model local thật sự có. - Nên dùng bản model lớn nhất máy chạy được, tránh bản nhỏ hoặc nén nặng. Model local không có bộ lọc an toàn như nhà cung cấp đám mây.
Nền tảng OpenClaw: OpenClaw là gì, Chạy OpenClaw 24/7: VPS hay máy Mac, Hướng dẫn cài OpenClaw trên VPS.
Nguồn: OpenClaw – Ollama · OpenClaw – Ollama setup · OpenClaw – Local models · OpenClaw – Custom providers
Hermes Agent: custom endpoint và context tối thiểu 64K
- Chạy
hermes modeltrong Terminal (ngoài phiên chat), chọn "Custom endpoint (self-hosted / VLLM / etc.)". - Nhập địa chỉ
http://localhost:11434/v1, bỏ qua khoá API (Ollama không cần), nhập tên model. - Tăng context của Ollama lên ít nhất 64000 token, rồi kiểm tra cột CONTEXT bằng
ollama ps.
# Trong ~/.hermes/config.yaml
model:
default: <tên model, vd qwen3.6:27b>
provider: custom
base_url: http://localhost:11434/v1
context_length: 64000
fallback_providers: # tuỳ chọn: model đám mây làm dự phòng
- provider: openrouter
model: <tên model đám mây>OLLAMA_CONTEXT_LENGTH=64000 ollama serve # trên máy chạy OllamaHermes cần ít nhất 64.000 token context cho việc agent có công cụ và từ chối khởi động nếu thấp hơn. Ollama trên máy VRAM dưới 24 GiB mặc định chỉ 4k token; Ollama chạy bằng systemd thì đặt biến theo cách ở mục nối VPS bên dưới. Một lưu ý trong tài liệu trí nhớ của Hermes: model nhỏ có thể nói "đã nhớ" mà không ghi thật.
Nền tảng Hermes: Hermes Agent là gì, Hướng dẫn cài Hermes trên VPS.
Nguồn: Hermes – AI Providers · Hermes – Memory
n8n: node Ollama Chat Model cho AI Agent
- Tạo credential Ollama trong n8n: Base URL mặc định
http://localhost:11434, không bắt buộc khoá API. Nếu báo lỗi, thửhttp://127.0.0.1:11434. - Trong AI Agent node, cắm node con Ollama Chat Model làm bộ não. Đừng dùng node Ollama Model (không phải Chat): node này không hỗ trợ công cụ nên không dùng được với AI Agent.
- Gắn ít nhất một công cụ cho AI Agent (yêu cầu của n8n), và bật người duyệt cho công cụ gửi tin, sửa dữ liệu.
- n8n chạy trong Docker, Ollama chạy trên máy: tài liệu n8n cho Ollama nghe
0.0.0.0và dùnghttp://host.docker.internal:11434(Linux thêm--add-host); khi đó chặn cổng 11434 bằng tường lửa, không mở ra Internet. - Hai container riêng: dùng tên container của Ollama làm địa chỉ.
- Self-hosted AI Starter Kit (Apache-2.0) gói sẵn n8n, Ollama, Qdrant, PostgreSQL; chỉ để thử.
Chi tiết AI Agent node: AI Agent trong n8n; phối hợp n8n với Agent: Kết hợp n8n với AI Agent.
Nguồn: n8n – Ollama credentials · Ollama Chat Model · Ollama Model · Ollama – lỗi thường gặp · Self-hosted AI Starter Kit
Mô hình lai: local làm chính, đám mây làm dự phòng
Thực tế nhất là chạy lai: việc thường ngày và dữ liệu nhạy cảm đi qua model local; việc khó, cần chất lượng cao, hoặc khi máy local quá tải thì chuyển sang Claude, GPT. Có ba cách làm theo tài liệu:
- LiteLLM (MIT, trừ thư mục enterprise): một proxy đứng giữa, gọi hơn 100 API model theo chuẩn OpenAI, có
fallbacksđể chuyển model khi lỗi,max_budgetvàbudget_durationđể giới hạn chi tiêu. Agent chỉ cần trỏ vào một địa chỉ. - OpenClaw: đặt
models.mode: "merge"để giữ model đám mây; đổi thứ tựprimaryvàfallbacksđể local làm chính, đám mây làm lưới an toàn. - Hermes: mục
fallback_providers(mẫu ở trên) thử lần lượt nhà cung cấp dự phòng khi model chính lỗi.
general_settings:
master_key: os.environ/LITELLM_MASTER_KEY # khoá quản trị, để trong biến môi trường
model_list:
- model_name: local
litellm_params:
model: ollama_chat/<tên model local>
api_base: http://localhost:11434
- model_name: cloud
litellm_params:
model: anthropic/<tên model Claude>
api_key: os.environ/ANTHROPIC_API_KEY # khoá nằm trong biến môi trường, không ghi thẳng vào tệp
litellm_settings:
num_retries: 2
fallbacks: [{"local": ["cloud"]}] # local lỗi thì chuyển sang cloud
max_budget: <số USD tối đa>
budget_duration: 30dKhoá API và hạn mức phía đám mây: Claude làm bộ não Agent, GPT làm bộ não Agent.
Nguồn: LiteLLM GitHub · LiteLLM – Ollama · LiteLLM – Fallbacks · LiteLLM – Budgets · OpenClaw – Local models
Nối Agent trên VPS với máy local an toàn
Agent chạy 24/7 trên VPS, máy có GPU ở văn phòng. Cách sai là đổi Ollama sang nghe mọi địa chỉ rồi mở cổng 11434 trên modem: API Ollama không có xác thực, và Cisco từng tìm thấy 1.139 máy chủ Ollama lộ ra Internet. Cách an toàn hơn là nối hai máy trong một mạng riêng. Đây là cách Aduca ghép từ tài liệu chính thức của Ollama (biến OLLAMA_HOST) và Tailscale, không phải hướng dẫn trọn gói của hãng nào:
- Cài Tailscale trên cả VPS và máy local. Tailscale tạo mạng riêng mã hoá dựa trên WireGuard; gói Personal miễn phí, tối đa 6 người dùng. Mỗi thiết bị nhận một địa chỉ dạng
100.x.y.z, chỉ máy trong mạng của bạn gọi được. - Đổi
OLLAMA_HOSTtrên máy local từ127.0.0.1:11434thành địa chỉ Tailscale của máy đó kèm cổng 11434 (cách đặt biến cho từng hệ điều hành: FAQ Ollama). Không đặt0.0.0.0, không mở cổng 11434 trên modem: Ollama chỉ nghe trong mạng riêng, không lộ ra Internet. Ứng dụng trên chính máy này khi đó cũng gọi qua địa chỉ Tailscale. - Trên VPS, trỏ Agent tới
http://100.x.y.z:11434(OpenClaw, n8n) hoặc thêm/v1(Hermes). Tài liệu OpenClaw ghi địa chỉ loopback, mạng riêng, tên máy trần không cần token thật, còn host công khai cần khoá; nếu báo thiếu khoá, xem mục Auth rules của trang đó. - Cấu hình dự phòng đám mây để Agent không "mất não" khi máy văn phòng tắt hoặc mất mạng.
# Linux, Ollama chạy bằng systemd
sudo systemctl edit ollama.service
# thêm dưới [Service]: Environment="OLLAMA_HOST=<<IP Tailscale>>:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollamaNguồn: Tailscale là gì · Tailscale – Pricing · Tailscale – địa chỉ IP · Ollama FAQ – OLLAMA_HOST · OpenClaw – Ollama setup (Auth rules) · Tailscale CLI · Cisco · vLLM – bảo mật
Giới hạn gọi công cụ của model nhỏ
- Gọi sai hoặc in JSON ra như chữ: do nối sai kiểu API (như OpenClaw với
/v1) hoặc model yếu về gọi công cụ. - Dễ bị chèn lệnh: tài liệu OpenClaw ghi không dùng bản model cũ, yếu, nhỏ cho Agent có công cụ hoặc hộp thư không tin cậy; nên dùng hộp cát, danh sách công cụ cho phép và Agent chỉ đọc cho nội dung lạ.
- Context ngắn làm mất dữ liệu âm thầm: tài liệu Aider ghi Ollama lặng lẽ bỏ phần vượt quá cửa sổ context.
- Tự công bố của hãng không phải kiểm chứng: model card Qwen3.6 (Apache-2.0) ghi mạnh về gọi công cụ, Gemma 4 (Apache-2.0) ghi hỗ trợ gọi công cụ có cấu trúc. Hãy tự thử trên quy trình thật.
- Chạy 20–30 tình huống thật, so kết quả với người làm.
- Kiểm tra từng công cụ được gọi đúng tham số, không có JSON lẫn trong câu trả lời.
- Thử tin nhắn có câu lệnh lừa AI; Agent tiếp khách không có quyền chạy lệnh.
- Giữ người duyệt cho mọi việc gửi tin, sửa dữ liệu, chi tiền.
Nguồn: OpenClaw – Prompt injection · Aider – Ollama · Qwen3.6 model card · Gemma 4 model card · n8n – người duyệt
Bắt đầu từ đâu?
- Một Agent, một việc chỉ đọc: ví dụ tóm tắt tài liệu nội bộ bằng model local, chưa cho gửi gì ra ngoài.
- Đặt context và dự phòng: tăng context đúng yêu cầu công cụ, cấu hình đường chuyển sang đám mây.
- Theo dõi hai tuần: so chất lượng, tốc độ, hoá đơn API trước và sau, rồi mới chuyển thêm việc.
Xem thêm Chi phí thật và bảo mật khi dùng AI Local và Lộ trình xây hệ thống AI Local. Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.
Đọc tiếp: Chi phí và bảo mật →
Câu hỏi thường gặp
Model local có thay được Claude hay GPT trong AI Agent không?
Thay được ở việc thường ngày như phân loại, tóm tắt, soạn nháp nội bộ, nếu máy chạy được model đủ lớn và context đủ dài. Với Agent có nhiều công cụ hoặc đọc tin nhắn từ người lạ, tài liệu OpenClaw khuyên không dùng model nhỏ, yếu. Cách thực tế là chạy lai: local làm chính, đám mây làm dự phòng cho việc khó.
Vì sao OpenClaw nối Ollama không được thêm /v1?
OpenClaw gọi API gốc của Ollama. Tài liệu OpenClaw cảnh báo dùng địa chỉ /v1 tương thích OpenAI sẽ làm hỏng việc gọi công cụ: model có thể in đoạn JSON gọi công cụ ra như chữ thường. Hãy dùng địa chỉ dạng http://host:11434, không có /v1.
Hermes báo context quá nhỏ khi dùng Ollama, làm sao?
Hermes cần ít nhất 64.000 token context cho việc agent và từ chối khởi động nếu thấp hơn. Ollama trên máy VRAM dưới 24 GiB mặc định chỉ 4k. Tăng ở phía máy chủ Ollama bằng biến OLLAMA_CONTEXT_LENGTH hoặc Modelfile, vì không đặt được qua API tương thích OpenAI, rồi kiểm tra bằng ollama ps.
Agent trên VPS gọi model trên máy văn phòng có an toàn không?
An toàn hơn nhiều nếu đi qua mạng riêng như Tailscale thay vì mở cổng 11434 ra Internet, vì API của Ollama không có xác thực. Cần thêm phương án dự phòng: khi máy văn phòng tắt hoặc mất mạng, Agent phải chuyển sang model đám mây hoặc báo lỗi rõ ràng.
Dùng model local có hết tốn tiền không?
Không còn phí API theo lượt cho phần chạy local, nhưng vẫn tốn tiền máy, điện và công vận hành. Phần việc chuyển sang đám mây vẫn tính phí theo token, nên đặt hạn mức ngân sách, ví dụ bằng max_budget của LiteLLM.
Tài liệu liên quan
- AI AgentChọn công cụ AI Agent: OpenClaw, Hermes, Claude, ChatGPT hay n8n?Chọn công cụ AI Agent: so sánh trung lập Claude, ChatGPT, OpenClaw, Hermes và n8n theo 10 tiêu chí có nguồn, kèm cách chọn cho 7 tình huống doanh nghiệp Việt.
- AI AgentKết hợp Claude, ChatGPT, OpenClaw, Hermes và n8n trong một doanh nghiệpKết hợp công cụ AI Agent trong doanh nghiệp: phân vai trợ lý, hệ thống 24/7 và n8n, luồng dữ liệu, quyền, chi phí, người phụ trách, lộ trình 30–60–90 ngày.
- AI AgentChatbot bán hàng chạy AI Local: trả lời tin nhắn, kho kiến thức sản phẩmChatbot bán hàng chạy AI Local: nối kênh chat qua n8n, OpenClaw, Hermes với model trên máy, kho kiến thức; ranh giới, người duyệt, kiểm thử, lúc cần đám mây.
- AI AgentKết hợp n8n với OpenClaw, Hermes, Claude, ChatGPT: đường ống + nhân viên sốKết hợp n8n với AI Agent: n8n lo luồng dữ liệu cố định, OpenClaw, Hermes, Claude, ChatGPT lo việc cần phán đoán; nối qua webhook có xác thực, MCP, bảng chung.
Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local
Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.
Nguồn tham khảo
- Ollama Docs – OpenAI compatibility
- LM Studio Docs – OpenAI compatible API
- OpenClaw Docs – Ollama
- OpenClaw Docs – Local models
- OpenClaw Docs – Prompt injection
- Hermes Agent Docs – AI Providers
- n8n Docs – Ollama credentials
- n8n Docs – Ollama Chat Model
- LiteLLM Docs – Fallbacks
- Tailscale – What is Tailscale
Lịch sử cập nhật
- 07/10/2026 — Bản đầu.
Miễn trừ trách nhiệm
Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.