Hiểu và dùng AI Local · Bài 4

Cài AI Local trong 30 phút: Ollama, LM Studio và Open WebUI

Phần cài đặt AI Local gọn hơn nhiều người nghĩ: một phần mềm chạy model, một file model mở, thêm giao diện chat nếu cả nhóm cùng dùng. Bài viết đi từng bước theo tài liệu chính thức của Ollama, LM Studio, Jan, llama.cpp và Open WebUI, kiểm tra ngày 07/10/2026. Thời gian thực tế phụ thuộc chủ yếu vào tốc độ tải model.

Cập nhật 07/10/2026⏱ 11 phút đọcCài đặt & bắt đầuNgười mới → Trung cấp

Muốn thử AI Local nhưng không biết bắt đầu từ đâu

Bạn đã đọc về AI Local, muốn thử xem model mở trả lời câu hỏi của khách, tóm tắt hợp đồng hay viết bài có ổn không. Nhưng mở mạng ra thì gặp cả chục cái tên: Ollama, LM Studio, Jan, llama.cpp, Open WebUI, AnythingLLM… Không rõ cài cái nào, cài xong chạy model gì, máy có chịu nổi không. (Tình huống minh hoạ.)

Bài này đi theo đúng thứ tự cần làm: chọn công cụ, cài theo hệ điều hành, chạy thử một model nhỏ, chỉnh độ dài context, rồi mới mở giao diện chat cho cả nhóm. Chưa rõ AI Local là gì, đọc trước AI Local là gì.

Cài AI Local gồm những gì?

Cài AI Local là cài một phần mềm chạy model (như Ollama hoặc LM Studio) lên máy tính, tải về một file model mở, rồi trò chuyện với model qua ứng dụng, qua giao diện web hoặc gọi qua API ngay trên máy đó.

Bốn lớp khi cài AI Local: máy tính Windows, macOS hoặc Linux với RAM, VRAM, ổ cứng; phần mềm chạy model gồm Ollama cổng 11434, LM Studio cổng 1234, Jan cổng 1337, llama.cpp cổng 8080; file model mở như Qwen, Gemma, gpt-oss cần đọc giấy phép; cách dùng qua Open WebUI cho cả nhóm hoặc API localhost:11434/v1 cho n8n, OpenClaw, Hermes; mặc định chỉ nghe trên chính máy
Hình: Bốn lớp của một bộ AI Local (minh hoạ)
  1. MáyRAM, VRAM, ổ cứng trống; xem cấu hình máy
  2. Phần mềm chạy modelOllama, LM Studio, Jan hoặc llama.cpp
  3. File model mởChọn theo việc và theo máy: bản đồ model mở
  4. Giao diện hoặc APIChat trong app, Open WebUI cho nhóm, API cho n8n và AI Agent
Bốn lớp của một bộ AI Local.

Chọn công cụ: Ollama, LM Studio, Jan hay llama.cpp

Công cụHệ điều hànhGiấy phép, chi phíCổng API mặc địnhPhù hợp với
OllamamacOS 14+, Windows 10 22H2+, LinuxMIT, miễn phí11434Người muốn cài nhanh, chạy nền, nối với n8n, AI Agent, Open WebUI
LM StudioMac Apple Silicon (macOS 14+), Windows x64/ARM, Linux x64/ARM64Miễn phí cả khi dùng cho công việc; điều khoản riêng: dùng cá nhân, nội bộ, cấm bán lại1234Người thích giao diện: tìm, tải, thử model bằng chuột
JanWindows 10+, macOS 13.6+, LinuxApache-2.0, miễn phí1337Người muốn app có giao diện, mã nguồn mở
llama.cppGần như mọi nền tảng, kể cả máy chỉ có CPUMIT, miễn phí8080Người kỹ thuật cần tinh chỉnh sâu, có sẵn khoá API

Hai công cụ dưới đây không chạy model, mà làm giao diện đặt lên trên:

Gợi ý ngắn: người mới dùng LM Studio để làm quen, hoặc Ollama nếu sắp nối với công cụ khác. Không cần cài hết; chọn một công cụ chạy model là đủ để bắt đầu.

Nguồn: Ollama GitHub · LM Studio – yêu cầu hệ thống · LM Studio miễn phí cho công việc · LM Studio – điều khoản · Jan · llama.cpp · Open WebUI – giấy phép · AnythingLLM Docs

Kiểm tra máy trước khi cài

Chưa chắc máy mình hợp model cỡ nào, xem bảng ước tính ở Cấu hình máy tính chạy AI Local.

Nguồn: Ollama – macOS · Ollama – Windows · LM Studio – yêu cầu hệ thống

Cài Ollama trên Windows, macOS, Linux

Windows

  1. Tải OllamaSetup.exe tại trang tải chính thức ollama.com/download và chạy. Bộ cài đặt vào tài khoản người dùng, không cần quyền Administrator.
  2. Cách khác theo README của Ollama: mở PowerShell và chạy lệnh cài dưới đây.
  3. Mở lại cửa sổ dòng lệnh, gõ ollama -v để kiểm tra. API chạy ở http://localhost:11434.
Lệnh trên máy tính của bạnDán vào PowerShell trên máy Windows của bạn
irm https://ollama.com/install.ps1 | iex

macOS

Tải tệp DMG ở ollama.com/download, kéo Ollama vào thư mục Applications rồi mở. Lần mở đầu, ứng dụng tạo lệnh ollama trong /usr/local/bin để dùng trong Terminal. Mac chip Apple dùng được GPU; Mac Intel chỉ chạy bằng CPU.

Linux

Lệnh trên máy tính của bạnDán vào Terminal trên máy Linux của bạn
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl daemon-reload && sudo systemctl enable ollama && sudo systemctl start ollama
ollama -v                     # in ra phiên bản là cài xong
journalctl -e -u ollama       # xem nhật ký khi có lỗi
Lệnh dạng "tải script rồi chạy ngay" (curl … | sh, irm … | iex) chỉ nên dùng với đúng địa chỉ chính thức ollama.com. Gõ tay hoặc copy từ tài liệu gốc, không copy từ trang lạ. Muốn cẩn thận hơn, tải script về, mở đọc trước rồi mới chạy. Cập nhật Ollama trên Linux bằng cách chạy lại script cài.

Nguồn: Ollama – Windows · Ollama – macOS · Ollama – Linux · Ollama README

Tải model nhỏ và chạy thử

Bắt đầu bằng model nhỏ để kiểm tra cài đặt cho nhanh, sau đó mới thử model lớn hơn. Các lệnh cơ bản:

Lệnh trên máy tính của bạnDán vào Terminal hoặc PowerShell trên máy của bạn
ollama pull qwen3.5:4b        # tải model (khoảng 3,3–4,0GB theo trang Ollama)
ollama run qwen3.5:4b         # mở phiên chat với model
ollama list                   # xem các model đã tải
ollama ps                     # model đang chạy, dùng GPU hay CPU, context bao nhiêu
ollama stop qwen3.5:4b        # giải phóng bộ nhớ
ollama rm qwen3.5:4b          # xoá model khỏi ổ cứng
Mức máy (ước tính)Model gợi ý để thử (dung lượng file trên Ollama)Giấy phép
8GB RAM hoặc card 8GBqwen3.5:4b (3,3–4,0GB), gemma4:e2b-it-qat (4,3GB)Apache-2.0
16GB RAM hoặc card 12–16GBqwen3.5:9b (6,6–7,6GB), gemma4:12b (7,7–8,0GB)Apache-2.0
24–36GB (Mac) hoặc card 24–32GBgemma4:26b (16–19GB), qwen3.8:27b (18GB)Apache-2.0

Bảng là ước tính Aduca ghép từ dung lượng file chính thức, không phải số đo tốc độ. Apache-2.0 cho phép dùng thương mại, nhưng vẫn nên đọc điều khoản trên trang model trước khi đưa vào kinh doanh. Lưu ý phi4-mini (MIT, 2,5GB) không có tiếng Việt trong danh sách ngôn ngữ trên trang model.

Gõ thử vài câu hỏi thật của doanh nghiệp bạn (hỏi giá, tóm tắt một email, viết một đoạn giới thiệu sản phẩm) để tự đánh giá tiếng Việt; hiện chưa có bảng xếp hạng tiếng Việt chính thức cho model mở. Khi chạy, nhìn cột PROCESSOR của ollama ps: "100% GPU" là model nằm gọn trong card; tỷ lệ chia kiểu "48%/52% CPU/GPU" nghĩa là tràn bộ nhớ, sẽ chậm, nên chọn model nhỏ hơn.

Nguồn: Ollama CLI · Ollama FAQ – ollama ps · Ollama – qwen3.5 · Ollama – gemma4 · Ollama – phi4-mini

Đặt độ dài context cho đúng việc

Context là lượng chữ (tính bằng token) model đọc được trong một lần: câu hỏi, lịch sử chat, tài liệu đính kèm. Ollama tự đặt context theo VRAM: dưới 24 GiB là 4k, 24–48 GiB là 32k, từ 48 GiB là 256k. 4k đủ cho hỏi đáp ngắn nhưng thiếu cho tài liệu dài, hỏi đáp kho kiến thức hay AI Agent.

Cách đặtLàm thế nào
Trong ứng dụng OllamaKéo thanh trượt context trong Settings
Cho cả máy chủ OllamaĐặt biến OLLAMA_CONTEXT_LENGTH (lệnh dưới đây)
Trong một phiên chatGõ /set parameter num_ctx 16384
Kiểm traollama ps, xem cột CONTEXT
Lệnh trên máy tính của bạnCú pháp cho Terminal macOS, Linux; ví dụ cho việc AI Agent
OLLAMA_CONTEXT_LENGTH=64000 ollama serve   # chạy máy chủ Ollama với context 64000 token

Mốc tham khảo theo tài liệu: Ollama khuyên việc agent, tìm web, lập trình đặt ít nhất 64000 token; Open WebUI khuyên hỏi đáp tài liệu từ 8192, tốt hơn là trên 16000. Context càng lớn càng tốn VRAM, nên tăng vừa đủ.

Nguồn: Ollama – Context length · Ollama FAQ – biến môi trường · Open WebUI – RAG

LM Studio, Jan và llama.cpp

LM Studio (có giao diện)

  1. Tải ứng dụng ở lmstudio.ai/download (Mac chip Apple, Windows, Linux dạng AppImage).
  2. Tìm model trong ứng dụng, tải về, bấm vào để chat. Chọn bản vừa bộ nhớ máy như bảng ở trên.
  3. Muốn công cụ khác gọi vào: bật máy chủ ở tab Developer, địa chỉ http://localhost:1234/v1.
  4. Mặc định máy chủ LM Studio không yêu cầu xác thực; vào Developers → Server Settings để tạo API token.

Máy chủ không có màn hình có thể cài bản không giao diện theo tài liệu LM Studio:

Lệnh trên máy tính của bạnDán vào Terminal; chỉ dùng địa chỉ chính thức lmstudio.ai
curl -fsSL https://lmstudio.ai/install.sh | bash   # Mac/Linux; Windows: irm https://lmstudio.ai/install.ps1 | iex
lms daemon up
lms server start

Jan

Tải ứng dụng ở trang GitHub chính thức của Jan, tải model từ Hugging Face ngay trong app. Jan có API tương thích OpenAI ở localhost:1337. README ghi mốc tham khảo trên macOS: 8GB RAM cho model 3B, 16GB cho 7B, 32GB cho 13B.

llama.cpp (cho người kỹ thuật)

Lệnh trên máy tính của bạnDán vào Terminal; lệnh theo README llama.cpp
curl -LsSf https://llama.app/install.sh | sh        # Mac/Linux; Windows: irm https://llama.app/install.ps1 | iex
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF          # mở máy chủ tương thích OpenAI

llama-server mặc định nghe 127.0.0.1:8080, có tuỳ chọn --api-key để bắt buộc khoá, -c để đặt context, --n-gpu-layers để chọn số lớp đưa lên GPU (mặc định tự động).

Nguồn: LM Studio Docs · LM Studio headless · LM Studio – xác thực · Jan · llama.cpp README · llama-server

Open WebUI: giao diện chat cho cả nhóm

Khi nhiều người cùng dùng một máy chạy model, Open WebUI cho mỗi người một tài khoản đăng nhập riêng, ngay trên trình duyệt. Cách được tài liệu khuyến nghị là Docker, trên máy đã cài Ollama:

Lệnh trên máy tính của bạnDán vào Terminal trên máy chạy Ollama (macOS, Linux); thay phần trong <…>. Trên Windows PowerShell, gộp thành một dòng và bỏ dấu \
openssl rand -hex 32   # tạo một chuỗi bí mật, lưu vào trình quản lý mật khẩu
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  -e WEBUI_SECRET_KEY=<chuỗi vừa tạo> \
  --name open-webui --restart always ghcr.io/open-webui/open-webui:main
  1. Mở http://localhost:3000. Tài khoản tạo đầu tiên trở thành admin, nên tự tạo ngay.
  2. Đăng ký mới mặc định tắt; admin bật "New Sign Ups" khi muốn mời nhân viên (tài khoản mới chờ admin duyệt) rồi tắt lại.
  3. Open WebUI chạy trong Docker tìm Ollama trên cùng máy qua http://host.docker.internal:11434. Muốn dùng LM Studio hay llama.cpp: vào Settings → Admin → Connections → "+ Add Connection".
  4. Cách khác không dùng Docker: Python 3.11 hoặc 3.12, pip install open-webui rồi open-webui serve, mở http://localhost:8080.
Open WebUI cho cả nhóm trong mạng nội bộ: nhân viên Sale, Marketing, Kế toán mở trình duyệt vào máy chung chạy Ollama và Open WebUI ở cổng 3000; tài khoản tạo đầu tiên là admin, admin tự bật đăng ký; không mở cổng 11434, 3000 ra Internet; làm việc ở xa qua VPN như Tailscale
Hình: Open WebUI cho cả nhóm, không mở cổng ra Internet (minh hoạ)
Chuỗi WEBUI_SECRET_KEY là khoá bí mật: chỉ lưu trên máy và trong trình quản lý mật khẩu, không gửi qua chat, không dán vào prompt. Về giấy phép: từ bản 0.6.6, không được xoá hay đổi tên, logo "Open WebUI" trừ khi hệ thống có tối đa 50 người dùng trong 30 ngày, có văn bản cho phép hoặc giấy phép doanh nghiệp. Dùng nội bộ và giữ nguyên thương hiệu thì không chạm điều khoản này; vẫn nên đọc toàn văn giấy phép.

Nguồn: Open WebUI – Quick start · Kết nối máy chủ tương thích OpenAI · Open WebUI – giấy phép

Lỗi thường gặp và cách xử lý

Hiện tượngNguyên nhân thường gặpCách xử lý
Trả lời rất chậmollama ps báo chia CPU/GPU: model tràn bộ nhớChọn model nhỏ hơn hoặc bản lượng tử hoá gọn hơn (vd Q4 thay vì Q8); đóng bớt ứng dụng nặng
Card NVIDIA không được dùng trên WindowsDriver cũCập nhật driver từ 551.61 trở lên
Không cài được LM StudioMac Intel, hoặc CPU Windows không có AVX2Dùng Ollama, Jan hoặc llama.cpp
Open WebUI không thấy modelTrỏ localhost từ bên trong DockerDùng http://host.docker.internal:11434
Hỏi tài liệu mà model như không đọcContext mặc định 4kTăng context từ 8192, tốt hơn là trên 16000
Ổ C hoặc ổ hệ thống đầyModel lưu ở thư mục người dùngĐặt biến OLLAMA_MODELS sang ổ khác
Ollama trên Linux không chạyDịch vụ chưa bật hoặc lỗiXem journalctl -e -u ollama

Nguồn: Ollama FAQ · Ollama – Windows · Ollama – Linux · LM Studio · Open WebUI

An toàn khi cài AI Local

Danh sách kiểm tra đầy đủ về chi phí và bảo mật: Chi phí thật và bảo mật khi dùng AI Local.

Nguồn: Ollama FAQ – mạng, cloud · Ollama – OpenAI compatibility · CVE-2026-7482 · Cisco – máy chủ Ollama lộ ra Internet · Open WebUI – advisories

Bắt đầu từ đâu?

  1. Hôm nay: cài một công cụ (LM Studio hoặc Ollama), tải một model nhỏ, hỏi 5–10 câu thật của doanh nghiệp.
  2. Tuần này: thử thêm một model cỡ vừa máy, chỉnh context, ghi lại model nào trả lời tiếng Việt đúng ý cho từng việc.
  3. Khi nhiều người cần dùng: dựng Open WebUI trên một máy chung trong mạng nội bộ, giữ cổng đóng với Internet, đặt người phụ trách cập nhật bản vá.

Bước tiếp theo: dùng AI Local cho viết content, hoặc nối làm bộ não cho OpenClaw, Hermes, n8n. Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.

Đọc tiếp: AI Local viết content →

Câu hỏi thường gặp

Nên cài Ollama hay LM Studio trước?

Nếu bạn quen bấm chuột và muốn xem model trong một ứng dụng có giao diện, LM Studio dễ làm quen. Nếu bạn định nối AI Local với n8n, OpenClaw, Hermes hoặc dùng Open WebUI cho cả nhóm, Ollama gọn hơn vì chạy nền và có sẵn API. Cả hai miễn phí, cài chung một máy được, chỉ cần để ý dung lượng ổ cứng vì mỗi bên giữ file model riêng.

Máy 8GB RAM có cài AI Local được không?

Được, với model nhỏ. Trang Ollama ghi các bản như qwen3.5:4b nặng khoảng 3,3–4,0GB, phi4-mini 2,5GB. LM Studio ghi máy 8GB chỉ chạy được model nhỏ và khuyên từ 16GB. Hãy bắt đầu bằng model nhỏ để kiểm tra cài đặt, rồi xem bài cấu hình máy trước khi nâng cấp.

Cài xong có cần Internet nữa không?

Chỉ cần mạng khi tải phần mềm, tải model và cập nhật. Sau đó chat với model local chạy trên máy. Ngoại lệ: model có hậu tố -cloud của Ollama, tìm kiếm web hoặc kết nối API đám mây trong các ứng dụng sẽ gửi dữ liệu ra ngoài.

Vì sao model trả lời như quên mất phần đầu tài liệu dài?

Thường do độ dài context. Trên máy có VRAM dưới 24 GiB, Ollama mặc định chỉ dùng 4k token. Phần vượt quá sẽ không được model đọc tới. Hãy tăng context theo mục "Đặt độ dài context" và kiểm tra bằng lệnh ollama ps.

Có nên mở Open WebUI ra Internet để làm việc ở nhà không?

Không nên mở thẳng cổng. Hãy dùng mạng riêng ảo như Tailscale để chỉ thiết bị của bạn vào được, hoặc đặt sau reverse proxy có xác thực, và luôn cập nhật Open WebUI lên bản mới vì phần mềm này thường xuyên vá lỗi bảo mật.

Tài liệu liên quan

Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local – Nguyễn Đức, Aduca
Bước tiếp theo

Đăng ký Tư vấn 1-1 về AI Local

Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.

Về AducaChuỗi bài do đội ngũ Aduca biên soạn từ kinh nghiệm đào tạo và triển khai AI Agent cho Marketing – Sales. Aduca Academy do Nguyễn Đức – Chủ tịch Aduca Group sáng lập; ông kinh doanh thương mại điện tử từ 2012, chạy quảng cáo Facebook từ 2014 và đào tạo từ 2016. Phần thực hành từng bước nằm trong các thư mục OpenClaw, Hermes Agent, Claude, ChatGPT và n8n.

Nguồn tham khảo

Lịch sử cập nhật

Miễn trừ trách nhiệm

Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.