Cài AI Local trong 30 phút: Ollama, LM Studio và Open WebUI
Phần cài đặt AI Local gọn hơn nhiều người nghĩ: một phần mềm chạy model, một file model mở, thêm giao diện chat nếu cả nhóm cùng dùng. Bài viết đi từng bước theo tài liệu chính thức của Ollama, LM Studio, Jan, llama.cpp và Open WebUI, kiểm tra ngày 07/10/2026. Thời gian thực tế phụ thuộc chủ yếu vào tốc độ tải model.
Muốn thử AI Local nhưng không biết bắt đầu từ đâu
Bạn đã đọc về AI Local, muốn thử xem model mở trả lời câu hỏi của khách, tóm tắt hợp đồng hay viết bài có ổn không. Nhưng mở mạng ra thì gặp cả chục cái tên: Ollama, LM Studio, Jan, llama.cpp, Open WebUI, AnythingLLM… Không rõ cài cái nào, cài xong chạy model gì, máy có chịu nổi không. (Tình huống minh hoạ.)
Bài này đi theo đúng thứ tự cần làm: chọn công cụ, cài theo hệ điều hành, chạy thử một model nhỏ, chỉnh độ dài context, rồi mới mở giao diện chat cho cả nhóm. Chưa rõ AI Local là gì, đọc trước AI Local là gì.
Cài AI Local gồm những gì?
Cài AI Local là cài một phần mềm chạy model (như Ollama hoặc LM Studio) lên máy tính, tải về một file model mở, rồi trò chuyện với model qua ứng dụng, qua giao diện web hoặc gọi qua API ngay trên máy đó.
- MáyRAM, VRAM, ổ cứng trống; xem cấu hình máy
- Phần mềm chạy modelOllama, LM Studio, Jan hoặc llama.cpp
- File model mởChọn theo việc và theo máy: bản đồ model mở
- Giao diện hoặc APIChat trong app, Open WebUI cho nhóm, API cho n8n và AI Agent
Chọn công cụ: Ollama, LM Studio, Jan hay llama.cpp
| Công cụ | Hệ điều hành | Giấy phép, chi phí | Cổng API mặc định | Phù hợp với |
|---|---|---|---|---|
| Ollama | macOS 14+, Windows 10 22H2+, Linux | MIT, miễn phí | 11434 | Người muốn cài nhanh, chạy nền, nối với n8n, AI Agent, Open WebUI |
| LM Studio | Mac Apple Silicon (macOS 14+), Windows x64/ARM, Linux x64/ARM64 | Miễn phí cả khi dùng cho công việc; điều khoản riêng: dùng cá nhân, nội bộ, cấm bán lại | 1234 | Người thích giao diện: tìm, tải, thử model bằng chuột |
| Jan | Windows 10+, macOS 13.6+, Linux | Apache-2.0, miễn phí | 1337 | Người muốn app có giao diện, mã nguồn mở |
| llama.cpp | Gần như mọi nền tảng, kể cả máy chỉ có CPU | MIT, miễn phí | 8080 | Người kỹ thuật cần tinh chỉnh sâu, có sẵn khoá API |
Hai công cụ dưới đây không chạy model, mà làm giao diện đặt lên trên:
- Open WebUI: giao diện chat trên trình duyệt cho cả nhóm, chạy bằng Docker hoặc Python 3.11/3.12, nối với Ollama hoặc bất kỳ API tương thích OpenAI. Giấy phép BSD-3 kèm điều khoản giữ thương hiệu từ bản 0.6.6.
- AnythingLLM: ứng dụng hỏi đáp tài liệu (giấy phép MIT). Bản Desktop cho một người, bản Docker cho nhiều người có mật khẩu. Chi tiết ở AI Local làm slide, tài liệu, Excel.
Gợi ý ngắn: người mới dùng LM Studio để làm quen, hoặc Ollama nếu sắp nối với công cụ khác. Không cần cài hết; chọn một công cụ chạy model là đủ để bắt đầu.
Nguồn: Ollama GitHub · LM Studio – yêu cầu hệ thống · LM Studio miễn phí cho công việc · LM Studio – điều khoản · Jan · llama.cpp · Open WebUI – giấy phép · AnythingLLM Docs
Kiểm tra máy trước khi cài
- Hệ điều hành: Ollama cần macOS 14 Sonoma trở lên hoặc Windows 10 bản 22H2 trở lên. LM Studio trên Mac chỉ chạy chip Apple (M1 trở đi), không hỗ trợ Mac Intel.
- CPU: LM Studio bản Windows x64 cần CPU có tập lệnh AVX2.
- Card NVIDIA trên Windows: driver từ 551.61 trở lên để Ollama dùng được card.
- Bộ nhớ: LM Studio khuyên từ 16GB RAM; máy 8GB chỉ hợp model nhỏ. Model phải nạp vào RAM (Mac) hoặc VRAM (card rời), nên file model cần nhỏ hơn rõ rệt so với bộ nhớ.
- Ổ cứng: riêng phần cài Ollama trên Windows cần khoảng 4GB; mỗi model nặng từ vài GB tới hàng chục, hàng trăm GB.
Chưa chắc máy mình hợp model cỡ nào, xem bảng ước tính ở Cấu hình máy tính chạy AI Local.
Nguồn: Ollama – macOS · Ollama – Windows · LM Studio – yêu cầu hệ thống
Cài Ollama trên Windows, macOS, Linux
Windows
- Tải
OllamaSetup.exetại trang tải chính thức ollama.com/download và chạy. Bộ cài đặt vào tài khoản người dùng, không cần quyền Administrator. - Cách khác theo README của Ollama: mở PowerShell và chạy lệnh cài dưới đây.
- Mở lại cửa sổ dòng lệnh, gõ
ollama -vđể kiểm tra. API chạy ởhttp://localhost:11434.
irm https://ollama.com/install.ps1 | iexmacOS
Tải tệp DMG ở ollama.com/download, kéo Ollama vào thư mục Applications rồi mở. Lần mở đầu, ứng dụng tạo lệnh ollama trong /usr/local/bin để dùng trong Terminal. Mac chip Apple dùng được GPU; Mac Intel chỉ chạy bằng CPU.
Linux
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl daemon-reload && sudo systemctl enable ollama && sudo systemctl start ollama
ollama -v # in ra phiên bản là cài xong
journalctl -e -u ollama # xem nhật ký khi có lỗicurl … | sh, irm … | iex) chỉ nên dùng với đúng địa chỉ chính thức ollama.com. Gõ tay hoặc copy từ tài liệu gốc, không copy từ trang lạ. Muốn cẩn thận hơn, tải script về, mở đọc trước rồi mới chạy. Cập nhật Ollama trên Linux bằng cách chạy lại script cài.Nguồn: Ollama – Windows · Ollama – macOS · Ollama – Linux · Ollama README
Tải model nhỏ và chạy thử
Bắt đầu bằng model nhỏ để kiểm tra cài đặt cho nhanh, sau đó mới thử model lớn hơn. Các lệnh cơ bản:
ollama pull qwen3.5:4b # tải model (khoảng 3,3–4,0GB theo trang Ollama)
ollama run qwen3.5:4b # mở phiên chat với model
ollama list # xem các model đã tải
ollama ps # model đang chạy, dùng GPU hay CPU, context bao nhiêu
ollama stop qwen3.5:4b # giải phóng bộ nhớ
ollama rm qwen3.5:4b # xoá model khỏi ổ cứng| Mức máy (ước tính) | Model gợi ý để thử (dung lượng file trên Ollama) | Giấy phép |
|---|---|---|
| 8GB RAM hoặc card 8GB | qwen3.5:4b (3,3–4,0GB), gemma4:e2b-it-qat (4,3GB) | Apache-2.0 |
| 16GB RAM hoặc card 12–16GB | qwen3.5:9b (6,6–7,6GB), gemma4:12b (7,7–8,0GB) | Apache-2.0 |
| 24–36GB (Mac) hoặc card 24–32GB | gemma4:26b (16–19GB), qwen3.8:27b (18GB) | Apache-2.0 |
Bảng là ước tính Aduca ghép từ dung lượng file chính thức, không phải số đo tốc độ. Apache-2.0 cho phép dùng thương mại, nhưng vẫn nên đọc điều khoản trên trang model trước khi đưa vào kinh doanh. Lưu ý phi4-mini (MIT, 2,5GB) không có tiếng Việt trong danh sách ngôn ngữ trên trang model.
Gõ thử vài câu hỏi thật của doanh nghiệp bạn (hỏi giá, tóm tắt một email, viết một đoạn giới thiệu sản phẩm) để tự đánh giá tiếng Việt; hiện chưa có bảng xếp hạng tiếng Việt chính thức cho model mở. Khi chạy, nhìn cột PROCESSOR của ollama ps: "100% GPU" là model nằm gọn trong card; tỷ lệ chia kiểu "48%/52% CPU/GPU" nghĩa là tràn bộ nhớ, sẽ chậm, nên chọn model nhỏ hơn.
Nguồn: Ollama CLI · Ollama FAQ – ollama ps · Ollama – qwen3.5 · Ollama – gemma4 · Ollama – phi4-mini
Đặt độ dài context cho đúng việc
Context là lượng chữ (tính bằng token) model đọc được trong một lần: câu hỏi, lịch sử chat, tài liệu đính kèm. Ollama tự đặt context theo VRAM: dưới 24 GiB là 4k, 24–48 GiB là 32k, từ 48 GiB là 256k. 4k đủ cho hỏi đáp ngắn nhưng thiếu cho tài liệu dài, hỏi đáp kho kiến thức hay AI Agent.
| Cách đặt | Làm thế nào |
|---|---|
| Trong ứng dụng Ollama | Kéo thanh trượt context trong Settings |
| Cho cả máy chủ Ollama | Đặt biến OLLAMA_CONTEXT_LENGTH (lệnh dưới đây) |
| Trong một phiên chat | Gõ /set parameter num_ctx 16384 |
| Kiểm tra | ollama ps, xem cột CONTEXT |
OLLAMA_CONTEXT_LENGTH=64000 ollama serve # chạy máy chủ Ollama với context 64000 token- macOS:
launchctl setenv OLLAMA_CONTEXT_LENGTH 64000rồi mở lại ứng dụng Ollama. - Linux:
sudo systemctl edit ollama.service, thêm dòngEnvironment="OLLAMA_CONTEXT_LENGTH=64000"dưới[Service], rồisudo systemctl daemon-reloadvàsudo systemctl restart ollama. - Windows: mở Settings, tìm "environment variables", thêm biến cho tài khoản người dùng, rồi khởi động lại Ollama.
Mốc tham khảo theo tài liệu: Ollama khuyên việc agent, tìm web, lập trình đặt ít nhất 64000 token; Open WebUI khuyên hỏi đáp tài liệu từ 8192, tốt hơn là trên 16000. Context càng lớn càng tốn VRAM, nên tăng vừa đủ.
Nguồn: Ollama – Context length · Ollama FAQ – biến môi trường · Open WebUI – RAG
LM Studio, Jan và llama.cpp
LM Studio (có giao diện)
- Tải ứng dụng ở lmstudio.ai/download (Mac chip Apple, Windows, Linux dạng AppImage).
- Tìm model trong ứng dụng, tải về, bấm vào để chat. Chọn bản vừa bộ nhớ máy như bảng ở trên.
- Muốn công cụ khác gọi vào: bật máy chủ ở tab Developer, địa chỉ
http://localhost:1234/v1. - Mặc định máy chủ LM Studio không yêu cầu xác thực; vào Developers → Server Settings để tạo API token.
Máy chủ không có màn hình có thể cài bản không giao diện theo tài liệu LM Studio:
curl -fsSL https://lmstudio.ai/install.sh | bash # Mac/Linux; Windows: irm https://lmstudio.ai/install.ps1 | iex
lms daemon up
lms server startJan
Tải ứng dụng ở trang GitHub chính thức của Jan, tải model từ Hugging Face ngay trong app. Jan có API tương thích OpenAI ở localhost:1337. README ghi mốc tham khảo trên macOS: 8GB RAM cho model 3B, 16GB cho 7B, 32GB cho 13B.
llama.cpp (cho người kỹ thuật)
curl -LsSf https://llama.app/install.sh | sh # Mac/Linux; Windows: irm https://llama.app/install.ps1 | iex
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF # mở máy chủ tương thích OpenAIllama-server mặc định nghe 127.0.0.1:8080, có tuỳ chọn --api-key để bắt buộc khoá, -c để đặt context, --n-gpu-layers để chọn số lớp đưa lên GPU (mặc định tự động).
Nguồn: LM Studio Docs · LM Studio headless · LM Studio – xác thực · Jan · llama.cpp README · llama-server
Open WebUI: giao diện chat cho cả nhóm
Khi nhiều người cùng dùng một máy chạy model, Open WebUI cho mỗi người một tài khoản đăng nhập riêng, ngay trên trình duyệt. Cách được tài liệu khuyến nghị là Docker, trên máy đã cài Ollama:
openssl rand -hex 32 # tạo một chuỗi bí mật, lưu vào trình quản lý mật khẩu
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
-e WEBUI_SECRET_KEY=<chuỗi vừa tạo> \
--name open-webui --restart always ghcr.io/open-webui/open-webui:main- Mở
http://localhost:3000. Tài khoản tạo đầu tiên trở thành admin, nên tự tạo ngay. - Đăng ký mới mặc định tắt; admin bật "New Sign Ups" khi muốn mời nhân viên (tài khoản mới chờ admin duyệt) rồi tắt lại.
- Open WebUI chạy trong Docker tìm Ollama trên cùng máy qua
http://host.docker.internal:11434. Muốn dùng LM Studio hay llama.cpp: vào Settings → Admin → Connections → "+ Add Connection". - Cách khác không dùng Docker: Python 3.11 hoặc 3.12,
pip install open-webuirồiopen-webui serve, mởhttp://localhost:8080.
WEBUI_SECRET_KEY là khoá bí mật: chỉ lưu trên máy và trong trình quản lý mật khẩu, không gửi qua chat, không dán vào prompt. Về giấy phép: từ bản 0.6.6, không được xoá hay đổi tên, logo "Open WebUI" trừ khi hệ thống có tối đa 50 người dùng trong 30 ngày, có văn bản cho phép hoặc giấy phép doanh nghiệp. Dùng nội bộ và giữ nguyên thương hiệu thì không chạm điều khoản này; vẫn nên đọc toàn văn giấy phép.Nguồn: Open WebUI – Quick start · Kết nối máy chủ tương thích OpenAI · Open WebUI – giấy phép
Lỗi thường gặp và cách xử lý
| Hiện tượng | Nguyên nhân thường gặp | Cách xử lý |
|---|---|---|
| Trả lời rất chậm | ollama ps báo chia CPU/GPU: model tràn bộ nhớ | Chọn model nhỏ hơn hoặc bản lượng tử hoá gọn hơn (vd Q4 thay vì Q8); đóng bớt ứng dụng nặng |
| Card NVIDIA không được dùng trên Windows | Driver cũ | Cập nhật driver từ 551.61 trở lên |
| Không cài được LM Studio | Mac Intel, hoặc CPU Windows không có AVX2 | Dùng Ollama, Jan hoặc llama.cpp |
| Open WebUI không thấy model | Trỏ localhost từ bên trong Docker | Dùng http://host.docker.internal:11434 |
| Hỏi tài liệu mà model như không đọc | Context mặc định 4k | Tăng context từ 8192, tốt hơn là trên 16000 |
| Ổ C hoặc ổ hệ thống đầy | Model lưu ở thư mục người dùng | Đặt biến OLLAMA_MODELS sang ổ khác |
| Ollama trên Linux không chạy | Dịch vụ chưa bật hoặc lỗi | Xem journalctl -e -u ollama |
Nguồn: Ollama FAQ · Ollama – Windows · Ollama – Linux · LM Studio · Open WebUI
An toàn khi cài AI Local
- Không mở cổng ra Internet. Ollama mặc định chỉ nghe
127.0.0.1:11434, tức chỉ chính máy đó gọi được. API của Ollama không có xác thực: khoá API "bắt buộc nhưng bị bỏ qua". Đừng đổiOLLAMA_HOSTsang mọi địa chỉ rồi mở cổng trên modem. Cisco (01/09/2025) đã tìm thấy 1.139 máy chủ Ollama lộ ra Internet. - Cập nhật bản vá. Ví dụ CVE-2026-7482 của Ollama (điểm 9.1, mức nghiêm trọng) có thể làm lộ biến môi trường, khoá API, nội dung hội thoại, đã vá từ bản 0.17.1. Open WebUI bản 0.11.4 cũng vá nhiều lỗi bảo mật. Hãy cập nhật cả phần mềm chạy model lẫn giao diện.
- Bật xác thực khi có: API token của LM Studio,
--api-keycủa llama-server. - Làm việc từ xa qua VPN như Tailscale hoặc reverse proxy có xác thực, xem bài nối máy local với AI Agent.
- Biết khi nào dữ liệu rời máy: model có hậu tố
-cloudcủa Ollama chạy trên máy chủ Ollama; tắt hẳn bằngOLLAMA_NO_CLOUD=1. Chỉ tải file model từ nguồn tin cậy.
Danh sách kiểm tra đầy đủ về chi phí và bảo mật: Chi phí thật và bảo mật khi dùng AI Local.
Nguồn: Ollama FAQ – mạng, cloud · Ollama – OpenAI compatibility · CVE-2026-7482 · Cisco – máy chủ Ollama lộ ra Internet · Open WebUI – advisories
Bắt đầu từ đâu?
- Hôm nay: cài một công cụ (LM Studio hoặc Ollama), tải một model nhỏ, hỏi 5–10 câu thật của doanh nghiệp.
- Tuần này: thử thêm một model cỡ vừa máy, chỉnh context, ghi lại model nào trả lời tiếng Việt đúng ý cho từng việc.
- Khi nhiều người cần dùng: dựng Open WebUI trên một máy chung trong mạng nội bộ, giữ cổng đóng với Internet, đặt người phụ trách cập nhật bản vá.
Bước tiếp theo: dùng AI Local cho viết content, hoặc nối làm bộ não cho OpenClaw, Hermes, n8n. Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.
Đọc tiếp: AI Local viết content →
Câu hỏi thường gặp
Nên cài Ollama hay LM Studio trước?
Nếu bạn quen bấm chuột và muốn xem model trong một ứng dụng có giao diện, LM Studio dễ làm quen. Nếu bạn định nối AI Local với n8n, OpenClaw, Hermes hoặc dùng Open WebUI cho cả nhóm, Ollama gọn hơn vì chạy nền và có sẵn API. Cả hai miễn phí, cài chung một máy được, chỉ cần để ý dung lượng ổ cứng vì mỗi bên giữ file model riêng.
Máy 8GB RAM có cài AI Local được không?
Được, với model nhỏ. Trang Ollama ghi các bản như qwen3.5:4b nặng khoảng 3,3–4,0GB, phi4-mini 2,5GB. LM Studio ghi máy 8GB chỉ chạy được model nhỏ và khuyên từ 16GB. Hãy bắt đầu bằng model nhỏ để kiểm tra cài đặt, rồi xem bài cấu hình máy trước khi nâng cấp.
Cài xong có cần Internet nữa không?
Chỉ cần mạng khi tải phần mềm, tải model và cập nhật. Sau đó chat với model local chạy trên máy. Ngoại lệ: model có hậu tố -cloud của Ollama, tìm kiếm web hoặc kết nối API đám mây trong các ứng dụng sẽ gửi dữ liệu ra ngoài.
Vì sao model trả lời như quên mất phần đầu tài liệu dài?
Thường do độ dài context. Trên máy có VRAM dưới 24 GiB, Ollama mặc định chỉ dùng 4k token. Phần vượt quá sẽ không được model đọc tới. Hãy tăng context theo mục "Đặt độ dài context" và kiểm tra bằng lệnh ollama ps.
Có nên mở Open WebUI ra Internet để làm việc ở nhà không?
Không nên mở thẳng cổng. Hãy dùng mạng riêng ảo như Tailscale để chỉ thiết bị của bạn vào được, hoặc đặt sau reverse proxy có xác thực, và luôn cập nhật Open WebUI lên bản mới vì phần mềm này thường xuyên vá lỗi bảo mật.
Tài liệu liên quan
- AI Local · AI AgentAI Local là gì? Chạy AI ngay trên máy tính, không tốn phí APIAI Local là gì: chạy model AI mở ngay trên máy tính của bạn, không trả phí API theo lượt, dữ liệu ở lại máy. Lợi ích, giới hạn, so sánh với AI đám mây.
- AI Local · AI AgentCấu hình máy tính chạy AI Local: RAM, VRAM, Mac hay PC NVIDIACấu hình máy tính chạy AI Local: RAM, VRAM quyết định model nào chạy được, cách ước tính dung lượng theo Q4/Q8, Mac hay PC NVIDIA, ổ cứng, mua máy hay thuê GPU.
- AI Local · AI AgentBản đồ model AI mở 2026: chọn model theo việc và theo máyBản đồ model AI mở 2026: Qwen, Gemma 4, gpt-oss, Llama 4, Mistral, GLM, DeepSeek, Phi; cỡ, MoE hay dense, giấy phép thương mại, tag Ollama, tự thử tiếng Việt.
- AI Local · AI AgentAI Local viết content: bài đăng, caption, kịch bản, emailAI Local viết content trên máy: chọn model mở theo giấy phép, prompt hệ thống giữ giọng thương hiệu, mẫu lệnh caption, kịch bản, email, quy trình duyệt.
Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local
Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.
Nguồn tham khảo
- Ollama Docs – Windows
- Ollama Docs – macOS
- Ollama Docs – Linux
- Ollama Docs – Context length
- Ollama Docs – FAQ (biến môi trường, mạng, dữ liệu)
- LM Studio Docs – Yêu cầu hệ thống
- LM Studio Docs – Chạy không giao diện
- Jan – GitHub (README, giấy phép)
- llama.cpp – GitHub (README)
- Open WebUI Docs – Quick start
Lịch sử cập nhật
- 07/10/2026 — Bản đầu.
Miễn trừ trách nhiệm
Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.