AI Local cho lập trình: trợ lý code chạy trên máy
Trợ lý code có thể chạy bằng model mở ngay trên máy của bạn, mã nguồn không phải gửi ra ngoài. Bài viết giới thiệu các công cụ phổ biến, model code và giấy phép, cách nối với Ollama theo tài liệu chính thức, quy tắc an toàn khi cho AI sửa tệp và chạy lệnh, và khi nào nên dùng Claude Code hay Codex trên đám mây. Dữ kiện kiểm tra ngày 07/10/2026.
Muốn có trợ lý code nhưng không được gửi mã nguồn ra ngoài
Một công ty phần mềm nhỏ làm dự án cho khách. Hợp đồng ghi rõ mã nguồn không được đưa lên dịch vụ bên ngoài. Lập trình viên thấy đồng nghiệp ở chỗ khác dùng trợ lý AI viết kiểm thử, sửa lỗi nhanh hơn, nhưng chính họ thì không dám dán mã của khách vào bất kỳ khung chat nào. (Tình huống minh hoạ.)
AI Local cho phép chạy model code ngay trên máy, nối với trình soạn code hoặc dòng lệnh quen thuộc. Bài này dành cho người đã biết lập trình cơ bản, hoặc người quản lý đội kỹ thuật muốn hiểu lựa chọn. Kiến thức nền: AI Local là gì.
Trợ lý code chạy AI Local là gì?
Trợ lý code chạy AI Local là một công cụ lập trình có AI (tiện ích trong trình soạn code hoặc chương trình dòng lệnh) được nối với model code chạy trên máy của bạn qua Ollama, LM Studio hay phần mềm tương tự, nên mã nguồn không phải gửi tới máy chủ của hãng AI.
Có ba mức dùng, rủi ro tăng dần:
| Mức | AI làm gì | Rủi ro |
|---|---|---|
| 1. Gợi ý, hỏi đáp | Giải thích mã, gợi ý đoạn code, bạn tự chép vào | Thấp |
| 2. Sửa tệp theo yêu cầu | AI sửa trực tiếp tệp trong dự án | Vừa: cần git để quay lại |
| 3. Agent | AI tự đọc nhiều tệp, sửa, chạy lệnh trong terminal | Cao: phải duyệt từng lệnh |
Các công cụ trợ lý code dùng được model local
| Công cụ | Giấy phép, nơi chạy | Cách nối model local (theo tài liệu) |
|---|---|---|
| Continue | Apache-2.0; VS Code, JetBrains, dòng lệnh | provider: ollama, model: <tên>; apiBase chỉ cần khi Ollama ở máy khác. Thiếu bộ nhớ thì giảm contextLength. |
| Cline | Apache-2.0; VS Code, JetBrains, dòng lệnh, ứng dụng máy tính | Chạy local qua Ollama hoặc LM Studio; tài liệu khuyên bật Use Compact Prompt. |
| Aider | Apache-2.0; dòng lệnh | OLLAMA_API_BASE rồi aider --model ollama_chat/<model>; Aider tự đặt context cho Ollama. |
| Codex CLI (OpenAI) | Apache-2.0; dòng lệnh | Cờ --oss dùng nhà cung cấp local như Ollama, LM Studio; chọn bằng --local-provider hoặc oss_provider trong config.toml. |
| Claude Code (Anthropic) | Công cụ của Anthropic; dòng lệnh, trình soạn code, ứng dụng | Ollama có API tương thích Anthropic: đặt ANTHROPIC_BASE_URL=http://localhost:11434, hoặc dùng ollama launch claude. |
Mẫu cấu hình Continue và lệnh khởi động các công cụ còn lại (theo tài liệu chính thức từng công cụ):
name: My Config
version: 0.0.1
schema: v1
models:
- name: Model code local
provider: ollama
model: <tên model, ví dụ qwen3-coder:30b>
# apiBase: http://<<máy chạy Ollama>>:11434 (chỉ cần khi Ollama ở máy khác)# Aider (macOS/Linux)
export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/<tên model>
# Codex CLI dùng model local qua Ollama hoặc LM Studio
# (chưa đặt oss_provider trong config.toml thì Codex hỏi chọn)
codex --oss
# Claude Code trỏ sang Ollama trên máy
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model <tên model>-cloud) chạy trên máy chủ của Ollama, nghĩa là mã nguồn rời khỏi máy. Nếu mục tiêu là giữ mã trên máy, chỉ chọn model đã tải về; tài liệu Ollama ghi có thể tắt hẳn bằng OLLAMA_NO_CLOUD=1.Nguồn: Continue – Ollama · Continue – GitHub · Cline – Ollama · Cline – GitHub · Aider – Ollama · Aider – GitHub · Codex – config · Codex – GitHub · Ollama – Claude Code · Ollama – FAQ
Chọn model code theo máy
| Model | Cỡ, dung lượng tải trên Ollama | Giấy phép | Ghi chú từ nguồn chính thức |
|---|---|---|---|
| gpt-oss-20b | 21B tổng, 3,6B kích hoạt; khoảng 14GB | Apache-2.0 | Model card: chạy trong khoảng 16GB bộ nhớ |
| Devstral (24B) | devstral:24b khoảng 14GB | Apache-2.0 | Mistral: đủ nhẹ cho một RTX 4090 hoặc Mac 32GB RAM |
| Qwen3-Coder-30B-A3B | 30,5B tổng, 3,3B kích hoạt; qwen3-coder:30b khoảng 19GB | Apache-2.0 | Context gốc 262.144 token |
| Qwen3-Coder-Next | 80B tổng, 3B kích hoạt; bản q4_K_M khoảng 52GB | Apache-2.0 | Hãng mô tả thiết kế cho agent lập trình và phát triển trên máy |
| Devstral 2 (123B) | Cần tối thiểu 4 GPU cỡ H100 | MIT có sửa đổi | Ngoài tầm máy cá nhân |
Model dạng MoE (chỉ kích hoạt một phần tham số) chạy nhanh hơn model cùng tổng cỡ, nhưng vẫn cần bộ nhớ cho toàn bộ tham số. Tài liệu Cline gợi ý: 16–32GB RAM cho model nhỏ hoặc đã lượng tử hoá, 32–64GB cho model code cỡ vừa, từ 64GB cho model lớn và context dài. Cách tính chi tiết ở Cấu hình máy chạy AI Local và Bản đồ model AI mở 2026.
Context quan trọng với lập trình vì AI phải đọc nhiều tệp. Ollama mặc định 4k token khi máy có dưới 24 GiB VRAM, trong khi tài liệu khuyên việc lập trình đặt ít nhất 64.000 token. Aider cảnh báo Ollama lặng lẽ bỏ phần vượt quá context; tài liệu Ollama về Claude Code cũng khuyên đặt 64k trở lên với kho mã lớn. Không có số token mỗi giây chính thức theo từng máy, nên hãy tự thử trên dự án thật.
Nguồn: gpt-oss-20b · Devstral · Ollama – devstral · Qwen3-Coder-30B-A3B · Ollama – qwen3-coder · Qwen3-Coder-Next · Devstral 2 · Cline – Running locally · Ollama – Context length
An toàn khi cho AI sửa tệp và chạy lệnh
Model chạy trên máy bạn giữ được mã nguồn, nhưng không làm cho AI bớt sai. Một agent có quyền chạy lệnh có thể xoá nhầm thư mục, cài gói lạ, hay làm theo câu lệnh giấu trong tệp README hoặc nội dung tải về. Tài liệu OpenClaw cũng khuyên không dùng model yếu, nhỏ cho agent có công cụ. Bốn lớp an toàn nên có:
- Làm trong thư mục riêng: chỉ mở đúng thư mục dự án, không mở cả thư mục người dùng hay ổ đĩa. Tốt hơn nữa, làm trên bản sao hoặc máy ảo khi thử công cụ mới.
- Có git hoặc sao lưu: tạo nhánh mới trước mỗi việc. Aider tự tạo commit sau mỗi lần sửa tệp và có lệnh
/undođể hoàn tác (tắt bằng--no-auto-commits). - Duyệt từng lệnh: ở chế độ Manual, Claude Code hỏi trước khi sửa tệp và trước khi chạy lệnh (trừ một nhóm lệnh chỉ đọc có sẵn). Cline có tính năng Auto Approve; tài liệu Cline cảnh báo chế độ YOLO "tắt mọi kiểm tra an toàn", có thể xoá tệp quan trọng hoặc chạy lệnh đổi cài đặt hệ thống.
- Chặn tệp bí mật: không để AI đọc tệp
.env, khoá, mật khẩu; không dán khoá vào khung chat hay chỉ dẫn.
rm -rf), lệnh cần quyền quản trị (sudo), lệnh tải và chạy script từ Internet, lệnh đẩy mã lên kho chung: luôn đọc kỹ, không hiểu thì bấm Từ chối và hỏi người có kinh nghiệm.Thêm một lưu ý mạng: API của Ollama không có xác thực và mặc định chỉ nghe ở 127.0.0.1:11434. Nếu cả đội dùng chung một máy chạy model, đừng mở cổng ra Internet; dùng VPN như Tailscale hoặc reverse proxy có xác thực (xem Chi phí và bảo mật AI Local).
Nguồn: Aider – Git · Claude Code – Permissions · Cline – Auto approve · OpenClaw – Prompt injection · Ollama – FAQ · Ollama – OpenAI compatibility
Quy trình giao việc an toàn (ví dụ minh hoạ)
- Tạo nhánh gitMỗi việc một nhánh
- Giao việc nhỏ, rõ phạm viMột lỗi, một hàm, vài tệp
- AI giải thích rồi đề xuấtBạn đọc thay đổi (diff)
- Duyệt lệnh, chạy kiểm thửLệnh lạ thì từ chối
- Commit hoặc bỏKhông đạt thì quay lại nhánh cũ
Mẫu yêu cầu giới hạn phạm vi, dùng được với mọi công cụ ở trên:
Trong thư mục dự án này, hàm <tên hàm> ở tệp <đường dẫn> đang <mô tả lỗi>.
Yêu cầu:
1. Đọc tệp liên quan, giải thích nguyên nhân trong 3–5 câu trước khi sửa.
2. Chỉ sửa tệp <đường dẫn>; không cài thêm thư viện, không đổi cấu hình.
3. Viết hoặc cập nhật kiểm thử cho trường hợp này.
4. Không chạy lệnh xoá tệp, lệnh cần quyền quản trị, hay tải script từ Internet.
5. Dừng lại và hỏi tôi nếu cần làm việc ngoài phạm vi trên.Khi nào dùng Claude Code hoặc Codex trên đám mây?
Model local hợp với việc nhỏ, rõ ràng và mã nhạy cảm. Nên cân nhắc model lớn trên đám mây khi:
- Việc lớn, nhiều tệp: tái cấu trúc, đổi kiến trúc, viết tính năng mới từ đầu.
- Máy không đủ bộ nhớ cho model code cỡ vừa và context từ 64K.
- Thử trên dự án thật thấy model local phải sửa đi sửa lại nhiều lần.
- Muốn giao việc chạy từ xa: Claude Code on the web (đang research preview) nhận việc trên kho GitHub và tự tạo pull request; Codex Cloud chạy trên máy của OpenAI, vẫn chạy khi máy bạn ngủ.
Về gói: Claude Code có trong mọi gói trả phí của Claude, gói Free không có. Codex có trong mọi gói ChatGPT kể cả Free và Go, giới hạn khác nhau; Codex Cloud không có cho Free, Go. Khi dùng đám mây, mã nguồn được gửi tới nhà cung cấp, nên kiểm tra hợp đồng với khách và chính sách dữ liệu của gói trước. Câu chuyện thật về vận hành website bằng Claude Code: Nhật ký Claude Code; Codex cho người không làm IT: Codex của OpenAI.
Cách kết hợp hay dùng: mã của khách, việc nhỏ hằng ngày chạy local; việc khó, mã không nhạy cảm dùng đám mây. Công cụ như Codex CLI, Claude Code dùng được cả hai kiểu nên đội không phải học hai công cụ.
Nguồn: Claude – Pricing · Claude Code – Overview · Claude Code on the web · Codex với gói ChatGPT
Bắt đầu từ đâu?
- Cài Ollama hoặc LM Studio theo Cài AI Local trong 30 phút, tải một model code vừa máy và đặt context đủ dài.
- Bắt đầu ở mức 1: cài Continue, hỏi đáp và nhờ giải thích mã trong một dự án thử.
- Lên mức 2, 3 có kiểm soát: thử Aider hoặc Cline trên nhánh git riêng, duyệt từng lệnh, so kết quả với cách làm cũ trước khi dùng cho dự án thật.
Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.
Đọc tiếp: Bộ não cho AI Agent →
Câu hỏi thường gặp
Trợ lý code chạy AI Local có thay được Claude Code hay Codex không?
Cho việc nhỏ, rõ ràng thì dùng tốt: giải thích đoạn mã, viết hàm, viết kiểm thử, sửa lỗi trong vài tệp. Với việc lớn nhiều tệp, cần lập luận dài, model mở chạy trên máy phổ thông thường chưa bằng model lớn trên đám mây. Cách thực tế là kết hợp: mã nhạy cảm và việc nhỏ dùng local, việc khó dùng đám mây.
Máy cấu hình thế nào thì chạy được model code?
Tài liệu Cline gợi ý 16–32GB RAM cho model nhỏ hoặc đã lượng tử hoá, 32–64GB cho model code cỡ vừa, từ 64GB cho model lớn và context dài. Ví dụ dung lượng tải trên Ollama: gpt-oss:20b khoảng 14GB, devstral:24b khoảng 14GB, qwen3-coder:30b khoảng 19GB. Cần thêm bộ nhớ cho context.
Có nên bật chế độ tự duyệt mọi lệnh cho nhanh?
Không nên, nhất là trên máy có dữ liệu thật. Tài liệu Cline ghi chế độ YOLO tắt mọi kiểm tra an toàn và có thể xoá tệp quan trọng mà không cảnh báo. Hãy duyệt từng lệnh, làm trong thư mục dự án riêng và luôn có git hoặc bản sao lưu để quay lại.
Model code mở có dùng cho dự án thương mại được không?
Các model code nêu trong bài như Qwen3-Coder, Devstral bản 24B, gpt-oss đều dùng giấy phép Apache-2.0, cho phép dùng thương mại. Riêng Devstral 2 bản 123B dùng giấy phép MIT có sửa đổi. Luôn đọc giấy phép trên model card trước khi dùng cho kinh doanh.
Vì sao trợ lý code local hay "quên" nội dung tệp đã đọc?
Thường do context quá ngắn. Ollama mặc định chỉ 4k token khi máy có dưới 24 GiB VRAM, và tài liệu Aider cảnh báo Ollama lặng lẽ bỏ phần vượt quá. Với lập trình, tài liệu Ollama khuyên đặt ít nhất 64.000 token nếu máy đủ bộ nhớ.
Tài liệu liên quan
- AI AgentChọn công cụ AI Agent: OpenClaw, Hermes, Claude, ChatGPT hay n8n?Chọn công cụ AI Agent: so sánh trung lập Claude, ChatGPT, OpenClaw, Hermes và n8n theo 10 tiêu chí có nguồn, kèm cách chọn cho 7 tình huống doanh nghiệp Việt.
- AI AgentKết hợp Claude, ChatGPT, OpenClaw, Hermes và n8n trong một doanh nghiệpKết hợp công cụ AI Agent trong doanh nghiệp: phân vai trợ lý, hệ thống 24/7 và n8n, luồng dữ liệu, quyền, chi phí, người phụ trách, lộ trình 30–60–90 ngày.
- AI AgentAI Agent trong n8n: nối Claude, ChatGPT, trí nhớ, công cụ và MCPAI Agent trong n8n: chọn model Claude hoặc GPT, thêm trí nhớ, công cụ, MCP; bắt người duyệt trước việc nhạy cảm; chi phí lượt chạy và token; giới hạn cần biết.
- AI AgentKết hợp n8n với OpenClaw, Hermes, Claude, ChatGPT: đường ống + nhân viên sốKết hợp n8n với AI Agent: n8n lo luồng dữ liệu cố định, OpenClaw, Hermes, Claude, ChatGPT lo việc cần phán đoán; nối qua webhook có xác thực, MCP, bảng chung.
Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local
Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.
Nguồn tham khảo
- Continue Docs – Ollama
- Cline Docs – Running models locally
- Cline Docs – Auto approve
- Aider Docs – Ollama
- Aider Docs – Git integration
- Codex – Advanced configuration (--oss)
- Ollama Docs – Claude Code
- Claude Code Docs – Permissions
- Qwen3-Coder-30B-A3B model card
- Ollama Docs – Context length
Lịch sử cập nhật
- 07/10/2026 — Bản đầu.
Miễn trừ trách nhiệm
Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.