Hiểu và dùng AI Local · Bài 11

Dùng AI Local làm bộ não cho OpenClaw, Hermes, n8n

Model chạy trên máy của bạn có thể làm bộ não cho AI Agent, giúp giảm hoá đơn API và giữ dữ liệu nội bộ trong nhà. Nhưng mỗi công cụ nối theo một cách riêng, và model nhỏ có giới hạn thật khi gọi công cụ. Bài viết tổng hợp từ tài liệu chính thức của Ollama, LM Studio, OpenClaw, Hermes Agent, n8n, LiteLLM và Tailscale, kiểm tra ngày 07/10/2026.

Cập nhật 07/10/2026⏱ 9 phút đọcKiến thức nềnTrung cấp → Nâng cao

Hoá đơn API tăng, dữ liệu nội bộ lại nhạy cảm

Đội của bạn đã có AI Agent chạy trên VPS và một workflow n8n phân loại đơn hàng. Hoá đơn API tăng dần, trong khi nhiều việc chỉ là đọc và tóm tắt tài liệu nội bộ mà bạn không muốn gửi ra ngoài. Bạn có một máy có GPU ở văn phòng và tự hỏi: cho Agent dùng model trên máy đó được không? (Tình huống minh hoạ.)

Được, nếu nối đúng cách và biết giới hạn. Bài dành cho người đã cài AI Local (Cài AI Local) và đã dùng một công cụ AI Agent.

AI Local làm bộ não cho AI Agent là gì?

Dùng AI Local làm bộ não cho AI Agent là trỏ Agent (OpenClaw, Hermes, n8n) tới địa chỉ API của phần mềm chạy model trên máy bạn, thay cho API đám mây, để Agent suy nghĩ bằng model mở mà không trả phí theo lượt.

Model là bộ não; trí nhớ, công cụ, kênh chat và lịch làm việc vẫn do OpenClaw, Hermes hay n8n đảm nhận. Đổi bộ não ảnh hưởng trực tiếp tới chất lượng suy luận và độ tin cậy khi gọi công cụ.

Một model local làm bộ não cho ba AI Agent: OpenClaw nối Ollama bằng baseUrl cổng 11434 không thêm /v1, model nhỏ không đọc hộp thư khách; Hermes Agent dùng custom endpoint localhost:11434/v1 với context tối thiểu 64K token; n8n dùng node Ollama Chat Model với Base URL localhost:11434; đám mây Claude, GPT làm dự phòng cho việc khó; Ollama đặt context 4K khi VRAM dưới 24 GiB
Hình: Một bộ não local, ba cách nối (minh hoạ)

Endpoint tương thích OpenAI: địa chỉ mặc định của từng công cụ

Hầu hết phần mềm chạy model mở một endpoint tương thích OpenAI: một địa chỉ API nói cùng "ngôn ngữ" với API của OpenAI. Nhiều phần mềm viết cho OpenAI chỉ cần đổi base URL là gọi được model local.

Công cụĐịa chỉ mặc địnhXác thực
Ollamahttp://localhost:11434/v1 (thêm /v1/messages kiểu Anthropic)Không có; khoá API "bắt buộc nhưng bị bỏ qua"
LM Studiohttp://localhost:1234/v1Mặc định tắt; bật API token được
llama.cpp (llama-server)http://127.0.0.1:8080/v1--api-key tuỳ chọn
Janlocalhost:1337Xem tài liệu Jan
vLLM (máy chủ nhiều người dùng)cổng 8000, /v1--api-key, chỉ bảo vệ một số đường dẫn

Lưu ý từ tài liệu Ollama: đây chỉ là một phần của API OpenAI; chưa hỗ trợ tool_choice, logprobs. Độ dài context cũng không đặt được qua API này, phải đặt ở phía máy chủ Ollama (tài liệu Hermes).

Nguồn: Ollama – OpenAI compatibility · LM Studio – OpenAI compat · LM Studio – xác thực · llama-server · Jan · vLLM – bảo mật

OpenClaw: dùng model local theo tài liệu chính thức

  1. Chạy openclaw onboard, chọn Ollama, rồi chọn chế độ: Local only (chỉ model trên máy) hoặc Cloud + Local.
  2. Đặt model chính cho Agent, ví dụ openclaw models set ollama/gemma4 (Gemma 4, Apache-2.0).
  3. Nếu khai báo tay, địa chỉ Ollama là baseUrl: "http://host:11434", không thêm /v1.
Tài liệu OpenClaw cảnh báo: dùng địa chỉ /v1 tương thích OpenAI với Ollama sẽ làm hỏng việc gọi công cụ. Với LM Studio thì ngược lại: baseUrl: "http://127.0.0.1:1234/v1", api: "openai-responses"; máy chủ tương thích OpenAI khác dùng api: "openai-completions".

Nền tảng OpenClaw: OpenClaw là gì, Chạy OpenClaw 24/7: VPS hay máy Mac, Hướng dẫn cài OpenClaw trên VPS.

Nguồn: OpenClaw – Ollama · OpenClaw – Ollama setup · OpenClaw – Local models · OpenClaw – Custom providers

Hermes Agent: custom endpoint và context tối thiểu 64K

  1. Chạy hermes model trong Terminal (ngoài phiên chat), chọn "Custom endpoint (self-hosted / VLLM / etc.)".
  2. Nhập địa chỉ http://localhost:11434/v1, bỏ qua khoá API (Ollama không cần), nhập tên model.
  3. Tăng context của Ollama lên ít nhất 64000 token, rồi kiểm tra cột CONTEXT bằng ollama ps.
Mẫu ~/.hermes/config.yamlCopy rồi chỉnh trong tệp trên máy chạy Hermes; thay phần trong <…>
# Trong ~/.hermes/config.yaml
model:
  default: <tên model, vd qwen3.6:27b>
  provider: custom
  base_url: http://localhost:11434/v1
  context_length: 64000
fallback_providers:            # tuỳ chọn: model đám mây làm dự phòng
  - provider: openrouter
    model: <tên model đám mây>
Lệnh trên máy tính của bạnDán vào Terminal trên máy chạy Ollama
OLLAMA_CONTEXT_LENGTH=64000 ollama serve   # trên máy chạy Ollama

Hermes cần ít nhất 64.000 token context cho việc agent có công cụ và từ chối khởi động nếu thấp hơn. Ollama trên máy VRAM dưới 24 GiB mặc định chỉ 4k token; Ollama chạy bằng systemd thì đặt biến theo cách ở mục nối VPS bên dưới. Một lưu ý trong tài liệu trí nhớ của Hermes: model nhỏ có thể nói "đã nhớ" mà không ghi thật.

Nền tảng Hermes: Hermes Agent là gì, Hướng dẫn cài Hermes trên VPS.

Nguồn: Hermes – AI Providers · Hermes – Memory

n8n: node Ollama Chat Model cho AI Agent

  1. Tạo credential Ollama trong n8n: Base URL mặc định http://localhost:11434, không bắt buộc khoá API. Nếu báo lỗi, thử http://127.0.0.1:11434.
  2. Trong AI Agent node, cắm node con Ollama Chat Model làm bộ não. Đừng dùng node Ollama Model (không phải Chat): node này không hỗ trợ công cụ nên không dùng được với AI Agent.
  3. Gắn ít nhất một công cụ cho AI Agent (yêu cầu của n8n), và bật người duyệt cho công cụ gửi tin, sửa dữ liệu.

Chi tiết AI Agent node: AI Agent trong n8n; phối hợp n8n với Agent: Kết hợp n8n với AI Agent.

Nguồn: n8n – Ollama credentials · Ollama Chat Model · Ollama Model · Ollama – lỗi thường gặp · Self-hosted AI Starter Kit

Mô hình lai: local làm chính, đám mây làm dự phòng

Thực tế nhất là chạy lai: việc thường ngày và dữ liệu nhạy cảm đi qua model local; việc khó, cần chất lượng cao, hoặc khi máy local quá tải thì chuyển sang Claude, GPT. Có ba cách làm theo tài liệu:

Mẫu config.yaml của LiteLLMCopy rồi chỉnh trên máy chạy LiteLLM; thay phần trong <…>
general_settings:
  master_key: os.environ/LITELLM_MASTER_KEY   # khoá quản trị, để trong biến môi trường
model_list:
  - model_name: local
    litellm_params:
      model: ollama_chat/<tên model local>
      api_base: http://localhost:11434
  - model_name: cloud
    litellm_params:
      model: anthropic/<tên model Claude>
      api_key: os.environ/ANTHROPIC_API_KEY   # khoá nằm trong biến môi trường, không ghi thẳng vào tệp
litellm_settings:
  num_retries: 2
  fallbacks: [{"local": ["cloud"]}]   # local lỗi thì chuyển sang cloud
  max_budget: <số USD tối đa>
  budget_duration: 30d

Khoá API và hạn mức phía đám mây: Claude làm bộ não Agent, GPT làm bộ não Agent.

Nguồn: LiteLLM GitHub · LiteLLM – Ollama · LiteLLM – Fallbacks · LiteLLM – Budgets · OpenClaw – Local models

Nối Agent trên VPS với máy local an toàn

Agent chạy 24/7 trên VPS, máy có GPU ở văn phòng. Cách sai là đổi Ollama sang nghe mọi địa chỉ rồi mở cổng 11434 trên modem: API Ollama không có xác thực, và Cisco từng tìm thấy 1.139 máy chủ Ollama lộ ra Internet. Cách an toàn hơn là nối hai máy trong một mạng riêng. Đây là cách Aduca ghép từ tài liệu chính thức của Ollama (biến OLLAMA_HOST) và Tailscale, không phải hướng dẫn trọn gói của hãng nào:

  1. Cài Tailscale trên cả VPS và máy local. Tailscale tạo mạng riêng mã hoá dựa trên WireGuard; gói Personal miễn phí, tối đa 6 người dùng. Mỗi thiết bị nhận một địa chỉ dạng 100.x.y.z, chỉ máy trong mạng của bạn gọi được.
  2. Đổi OLLAMA_HOST trên máy local từ 127.0.0.1:11434 thành địa chỉ Tailscale của máy đó kèm cổng 11434 (cách đặt biến cho từng hệ điều hành: FAQ Ollama). Không đặt 0.0.0.0, không mở cổng 11434 trên modem: Ollama chỉ nghe trong mạng riêng, không lộ ra Internet. Ứng dụng trên chính máy này khi đó cũng gọi qua địa chỉ Tailscale.
  3. Trên VPS, trỏ Agent tới http://100.x.y.z:11434 (OpenClaw, n8n) hoặc thêm /v1 (Hermes). Tài liệu OpenClaw ghi địa chỉ loopback, mạng riêng, tên máy trần không cần token thật, còn host công khai cần khoá; nếu báo thiếu khoá, xem mục Auth rules của trang đó.
  4. Cấu hình dự phòng đám mây để Agent không "mất não" khi máy văn phòng tắt hoặc mất mạng.
Lệnh trên máy tính của bạnChạy trên máy local; xem IP bằng lệnh tailscale ip -4
# Linux, Ollama chạy bằng systemd
sudo systemctl edit ollama.service
# thêm dưới [Service]: Environment="OLLAMA_HOST=<<IP Tailscale>>:11434"
sudo systemctl daemon-reload && sudo systemctl restart ollama
Nối AI Agent trên VPS với máy AI Local: VPS chạy OpenClaw, Hermes, n8n gọi máy có GPU chạy Ollama qua mạng riêng Tailscale dựa trên WireGuard; không mở cổng 11434 ra Internet; Ollama nghe ở IP Tailscale, Agent gọi http://100.x.y.z:11434; khi máy local tắt, LiteLLM fallbacks, OpenClaw models.mode merge, Hermes fallback_providers chuyển sang model đám mây
Hình: Agent trên VPS gọi model local qua mạng riêng (minh hoạ)
Nếu bắt buộc đi qua Internet, đặt sau reverse proxy có xác thực, chỉ cho phép các đường dẫn cần thiết, có giới hạn tần suất và ghi log, như tài liệu vLLM khuyến nghị. Khoá, token chỉ để trong biến môi trường hoặc tệp .env trên máy, không gửi qua chat.

Nguồn: Tailscale là gì · Tailscale – Pricing · Tailscale – địa chỉ IP · Ollama FAQ – OLLAMA_HOST · OpenClaw – Ollama setup (Auth rules) · Tailscale CLI · Cisco · vLLM – bảo mật

Giới hạn gọi công cụ của model nhỏ

Nguồn: OpenClaw – Prompt injection · Aider – Ollama · Qwen3.6 model card · Gemma 4 model card · n8n – người duyệt

Bắt đầu từ đâu?

  1. Một Agent, một việc chỉ đọc: ví dụ tóm tắt tài liệu nội bộ bằng model local, chưa cho gửi gì ra ngoài.
  2. Đặt context và dự phòng: tăng context đúng yêu cầu công cụ, cấu hình đường chuyển sang đám mây.
  3. Theo dõi hai tuần: so chất lượng, tốc độ, hoá đơn API trước và sau, rồi mới chuyển thêm việc.

Xem thêm Chi phí thật và bảo mật khi dùng AI Local và Lộ trình xây hệ thống AI Local. Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.

Đọc tiếp: Chi phí và bảo mật →

Câu hỏi thường gặp

Model local có thay được Claude hay GPT trong AI Agent không?

Thay được ở việc thường ngày như phân loại, tóm tắt, soạn nháp nội bộ, nếu máy chạy được model đủ lớn và context đủ dài. Với Agent có nhiều công cụ hoặc đọc tin nhắn từ người lạ, tài liệu OpenClaw khuyên không dùng model nhỏ, yếu. Cách thực tế là chạy lai: local làm chính, đám mây làm dự phòng cho việc khó.

Vì sao OpenClaw nối Ollama không được thêm /v1?

OpenClaw gọi API gốc của Ollama. Tài liệu OpenClaw cảnh báo dùng địa chỉ /v1 tương thích OpenAI sẽ làm hỏng việc gọi công cụ: model có thể in đoạn JSON gọi công cụ ra như chữ thường. Hãy dùng địa chỉ dạng http://host:11434, không có /v1.

Hermes báo context quá nhỏ khi dùng Ollama, làm sao?

Hermes cần ít nhất 64.000 token context cho việc agent và từ chối khởi động nếu thấp hơn. Ollama trên máy VRAM dưới 24 GiB mặc định chỉ 4k. Tăng ở phía máy chủ Ollama bằng biến OLLAMA_CONTEXT_LENGTH hoặc Modelfile, vì không đặt được qua API tương thích OpenAI, rồi kiểm tra bằng ollama ps.

Agent trên VPS gọi model trên máy văn phòng có an toàn không?

An toàn hơn nhiều nếu đi qua mạng riêng như Tailscale thay vì mở cổng 11434 ra Internet, vì API của Ollama không có xác thực. Cần thêm phương án dự phòng: khi máy văn phòng tắt hoặc mất mạng, Agent phải chuyển sang model đám mây hoặc báo lỗi rõ ràng.

Dùng model local có hết tốn tiền không?

Không còn phí API theo lượt cho phần chạy local, nhưng vẫn tốn tiền máy, điện và công vận hành. Phần việc chuyển sang đám mây vẫn tính phí theo token, nên đặt hạn mức ngân sách, ví dụ bằng max_budget của LiteLLM.

Tài liệu liên quan

Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local – Nguyễn Đức, Aduca
Bước tiếp theo

Đăng ký Tư vấn 1-1 về AI Local

Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.

Về AducaChuỗi bài do đội ngũ Aduca biên soạn từ kinh nghiệm đào tạo và triển khai AI Agent cho Marketing – Sales. Aduca Academy do Nguyễn Đức – Chủ tịch Aduca Group sáng lập; ông kinh doanh thương mại điện tử từ 2012, chạy quảng cáo Facebook từ 2014 và đào tạo từ 2016. Phần thực hành từng bước nằm trong các thư mục OpenClaw, Hermes Agent, Claude, ChatGPT và n8n.

Nguồn tham khảo

Lịch sử cập nhật

Miễn trừ trách nhiệm

Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.