Hiểu và dùng AI Local · Bài 10

AI Local cho lập trình: trợ lý code chạy trên máy

Trợ lý code có thể chạy bằng model mở ngay trên máy của bạn, mã nguồn không phải gửi ra ngoài. Bài viết giới thiệu các công cụ phổ biến, model code và giấy phép, cách nối với Ollama theo tài liệu chính thức, quy tắc an toàn khi cho AI sửa tệp và chạy lệnh, và khi nào nên dùng Claude Code hay Codex trên đám mây. Dữ kiện kiểm tra ngày 07/10/2026.

Cập nhật 07/10/2026⏱ 8 phút đọcKiến thức nềnTrung cấp

Muốn có trợ lý code nhưng không được gửi mã nguồn ra ngoài

Một công ty phần mềm nhỏ làm dự án cho khách. Hợp đồng ghi rõ mã nguồn không được đưa lên dịch vụ bên ngoài. Lập trình viên thấy đồng nghiệp ở chỗ khác dùng trợ lý AI viết kiểm thử, sửa lỗi nhanh hơn, nhưng chính họ thì không dám dán mã của khách vào bất kỳ khung chat nào. (Tình huống minh hoạ.)

AI Local cho phép chạy model code ngay trên máy, nối với trình soạn code hoặc dòng lệnh quen thuộc. Bài này dành cho người đã biết lập trình cơ bản, hoặc người quản lý đội kỹ thuật muốn hiểu lựa chọn. Kiến thức nền: AI Local là gì.

Trợ lý code chạy AI Local là gì?

Trợ lý code chạy AI Local là một công cụ lập trình có AI (tiện ích trong trình soạn code hoặc chương trình dòng lệnh) được nối với model code chạy trên máy của bạn qua Ollama, LM Studio hay phần mềm tương tự, nên mã nguồn không phải gửi tới máy chủ của hãng AI.

Có ba mức dùng, rủi ro tăng dần:

MứcAI làm gìRủi ro
1. Gợi ý, hỏi đápGiải thích mã, gợi ý đoạn code, bạn tự chép vàoThấp
2. Sửa tệp theo yêu cầuAI sửa trực tiếp tệp trong dự ánVừa: cần git để quay lại
3. AgentAI tự đọc nhiều tệp, sửa, chạy lệnh trong terminalCao: phải duyệt từng lệnh
Trợ lý code chạy AI Local: trình soạn code trên máy của bạn nối với model code chạy local qua Ollama hoặc LM Studio; ba mức dùng gồm gợi ý, hỏi đáp trong trình soạn như Continue, sửa tệp theo yêu cầu như Aider mỗi lần sửa một commit git, và agent tự đọc, sửa, chạy lệnh như Cline, Codex CLI chế độ oss phải duyệt từng lệnh; mã nguồn không gửi lên dịch vụ ngoài; việc lớn cân nhắc Claude Code, Codex trên đám mây
Hình: Ba mức dùng trợ lý code chạy trên máy (minh hoạ)

Các công cụ trợ lý code dùng được model local

Công cụGiấy phép, nơi chạyCách nối model local (theo tài liệu)
ContinueApache-2.0; VS Code, JetBrains, dòng lệnhprovider: ollama, model: <tên>; apiBase chỉ cần khi Ollama ở máy khác. Thiếu bộ nhớ thì giảm contextLength.
ClineApache-2.0; VS Code, JetBrains, dòng lệnh, ứng dụng máy tínhChạy local qua Ollama hoặc LM Studio; tài liệu khuyên bật Use Compact Prompt.
AiderApache-2.0; dòng lệnhOLLAMA_API_BASE rồi aider --model ollama_chat/<model>; Aider tự đặt context cho Ollama.
Codex CLI (OpenAI)Apache-2.0; dòng lệnhCờ --oss dùng nhà cung cấp local như Ollama, LM Studio; chọn bằng --local-provider hoặc oss_provider trong config.toml.
Claude Code (Anthropic)Công cụ của Anthropic; dòng lệnh, trình soạn code, ứng dụngOllama có API tương thích Anthropic: đặt ANTHROPIC_BASE_URL=http://localhost:11434, hoặc dùng ollama launch claude.

Mẫu cấu hình Continue và lệnh khởi động các công cụ còn lại (theo tài liệu chính thức từng công cụ):

Tệp config.yaml của ContinueCopy rồi dán vào tệp config.yaml; thay phần trong <…>
name: My Config
version: 0.0.1
schema: v1
models:
  - name: Model code local
    provider: ollama
    model: <tên model, ví dụ qwen3-coder:30b>
    # apiBase: http://<<máy chạy Ollama>>:11434   (chỉ cần khi Ollama ở máy khác)
Lệnh trên máy tính của bạnChạy trong thư mục dự án; thay phần trong <…>; trên Windows đặt biến môi trường tương ứng
# Aider (macOS/Linux)
export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/<tên model>

# Codex CLI dùng model local qua Ollama hoặc LM Studio
# (chưa đặt oss_provider trong config.toml thì Codex hỏi chọn)
codex --oss

# Claude Code trỏ sang Ollama trên máy
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model <tên model>
Ollama có cả model đám mây (tag có hậu tố -cloud) chạy trên máy chủ của Ollama, nghĩa là mã nguồn rời khỏi máy. Nếu mục tiêu là giữ mã trên máy, chỉ chọn model đã tải về; tài liệu Ollama ghi có thể tắt hẳn bằng OLLAMA_NO_CLOUD=1.

Nguồn: Continue – Ollama · Continue – GitHub · Cline – Ollama · Cline – GitHub · Aider – Ollama · Aider – GitHub · Codex – config · Codex – GitHub · Ollama – Claude Code · Ollama – FAQ

Chọn model code theo máy

ModelCỡ, dung lượng tải trên OllamaGiấy phépGhi chú từ nguồn chính thức
gpt-oss-20b21B tổng, 3,6B kích hoạt; khoảng 14GBApache-2.0Model card: chạy trong khoảng 16GB bộ nhớ
Devstral (24B)devstral:24b khoảng 14GBApache-2.0Mistral: đủ nhẹ cho một RTX 4090 hoặc Mac 32GB RAM
Qwen3-Coder-30B-A3B30,5B tổng, 3,3B kích hoạt; qwen3-coder:30b khoảng 19GBApache-2.0Context gốc 262.144 token
Qwen3-Coder-Next80B tổng, 3B kích hoạt; bản q4_K_M khoảng 52GBApache-2.0Hãng mô tả thiết kế cho agent lập trình và phát triển trên máy
Devstral 2 (123B)Cần tối thiểu 4 GPU cỡ H100MIT có sửa đổiNgoài tầm máy cá nhân

Model dạng MoE (chỉ kích hoạt một phần tham số) chạy nhanh hơn model cùng tổng cỡ, nhưng vẫn cần bộ nhớ cho toàn bộ tham số. Tài liệu Cline gợi ý: 16–32GB RAM cho model nhỏ hoặc đã lượng tử hoá, 32–64GB cho model code cỡ vừa, từ 64GB cho model lớn và context dài. Cách tính chi tiết ở Cấu hình máy chạy AI Local và Bản đồ model AI mở 2026.

Context quan trọng với lập trình vì AI phải đọc nhiều tệp. Ollama mặc định 4k token khi máy có dưới 24 GiB VRAM, trong khi tài liệu khuyên việc lập trình đặt ít nhất 64.000 token. Aider cảnh báo Ollama lặng lẽ bỏ phần vượt quá context; tài liệu Ollama về Claude Code cũng khuyên đặt 64k trở lên với kho mã lớn. Không có số token mỗi giây chính thức theo từng máy, nên hãy tự thử trên dự án thật.

Nguồn: gpt-oss-20b · Devstral · Ollama – devstral · Qwen3-Coder-30B-A3B · Ollama – qwen3-coder · Qwen3-Coder-Next · Devstral 2 · Cline – Running locally · Ollama – Context length

An toàn khi cho AI sửa tệp và chạy lệnh

Model chạy trên máy bạn giữ được mã nguồn, nhưng không làm cho AI bớt sai. Một agent có quyền chạy lệnh có thể xoá nhầm thư mục, cài gói lạ, hay làm theo câu lệnh giấu trong tệp README hoặc nội dung tải về. Tài liệu OpenClaw cũng khuyên không dùng model yếu, nhỏ cho agent có công cụ. Bốn lớp an toàn nên có:

Bốn lớp an toàn khi cho AI sửa tệp, chạy lệnh: làm trong thư mục dự án riêng, dùng git và sao lưu tạo nhánh mới trước khi giao việc, duyệt từng lệnh không bật chế độ tự chạy mọi lệnh, chặn tệp bí mật như .env, khoá, mật khẩu; ví dụ AI đề xuất lệnh rm -rf xoá thư mục chờ người bấm Duyệt hoặc Từ chối; lệnh xoá, sudo, tải và chạy script từ mạng phải dừng lại hỏi người hiểu kỹ thuật
Hình: Bốn lớp an toàn khi cho trợ lý code chạy lệnh (minh hoạ)
  1. Làm trong thư mục riêng: chỉ mở đúng thư mục dự án, không mở cả thư mục người dùng hay ổ đĩa. Tốt hơn nữa, làm trên bản sao hoặc máy ảo khi thử công cụ mới.
  2. Có git hoặc sao lưu: tạo nhánh mới trước mỗi việc. Aider tự tạo commit sau mỗi lần sửa tệp và có lệnh /undo để hoàn tác (tắt bằng --no-auto-commits).
  3. Duyệt từng lệnh: ở chế độ Manual, Claude Code hỏi trước khi sửa tệp và trước khi chạy lệnh (trừ một nhóm lệnh chỉ đọc có sẵn). Cline có tính năng Auto Approve; tài liệu Cline cảnh báo chế độ YOLO "tắt mọi kiểm tra an toàn", có thể xoá tệp quan trọng hoặc chạy lệnh đổi cài đặt hệ thống.
  4. Chặn tệp bí mật: không để AI đọc tệp .env, khoá, mật khẩu; không dán khoá vào khung chat hay chỉ dẫn.
Lệnh xoá (rm -rf), lệnh cần quyền quản trị (sudo), lệnh tải và chạy script từ Internet, lệnh đẩy mã lên kho chung: luôn đọc kỹ, không hiểu thì bấm Từ chối và hỏi người có kinh nghiệm.

Thêm một lưu ý mạng: API của Ollama không có xác thực và mặc định chỉ nghe ở 127.0.0.1:11434. Nếu cả đội dùng chung một máy chạy model, đừng mở cổng ra Internet; dùng VPN như Tailscale hoặc reverse proxy có xác thực (xem Chi phí và bảo mật AI Local).

Nguồn: Aider – Git · Claude Code – Permissions · Cline – Auto approve · OpenClaw – Prompt injection · Ollama – FAQ · Ollama – OpenAI compatibility

Quy trình giao việc an toàn (ví dụ minh hoạ)

  1. Tạo nhánh gitMỗi việc một nhánh
  2. Giao việc nhỏ, rõ phạm viMột lỗi, một hàm, vài tệp
  3. AI giải thích rồi đề xuấtBạn đọc thay đổi (diff)
  4. Duyệt lệnh, chạy kiểm thửLệnh lạ thì từ chối
  5. Commit hoặc bỏKhông đạt thì quay lại nhánh cũ
Năm bước giao việc cho trợ lý code chạy local.

Mẫu yêu cầu giới hạn phạm vi, dùng được với mọi công cụ ở trên:

Gửi cho trợ lý codeCopy rồi dán vào khung chat của công cụ; thay phần trong <…>
Trong thư mục dự án này, hàm <tên hàm> ở tệp <đường dẫn> đang <mô tả lỗi>.
Yêu cầu:
1. Đọc tệp liên quan, giải thích nguyên nhân trong 3–5 câu trước khi sửa.
2. Chỉ sửa tệp <đường dẫn>; không cài thêm thư viện, không đổi cấu hình.
3. Viết hoặc cập nhật kiểm thử cho trường hợp này.
4. Không chạy lệnh xoá tệp, lệnh cần quyền quản trị, hay tải script từ Internet.
5. Dừng lại và hỏi tôi nếu cần làm việc ngoài phạm vi trên.

Khi nào dùng Claude Code hoặc Codex trên đám mây?

Model local hợp với việc nhỏ, rõ ràng và mã nhạy cảm. Nên cân nhắc model lớn trên đám mây khi:

Về gói: Claude Code có trong mọi gói trả phí của Claude, gói Free không có. Codex có trong mọi gói ChatGPT kể cả Free và Go, giới hạn khác nhau; Codex Cloud không có cho Free, Go. Khi dùng đám mây, mã nguồn được gửi tới nhà cung cấp, nên kiểm tra hợp đồng với khách và chính sách dữ liệu của gói trước. Câu chuyện thật về vận hành website bằng Claude Code: Nhật ký Claude Code; Codex cho người không làm IT: Codex của OpenAI.

Cách kết hợp hay dùng: mã của khách, việc nhỏ hằng ngày chạy local; việc khó, mã không nhạy cảm dùng đám mây. Công cụ như Codex CLI, Claude Code dùng được cả hai kiểu nên đội không phải học hai công cụ.

Nguồn: Claude – Pricing · Claude Code – Overview · Claude Code on the web · Codex với gói ChatGPT

Bắt đầu từ đâu?

  1. Cài Ollama hoặc LM Studio theo Cài AI Local trong 30 phút, tải một model code vừa máy và đặt context đủ dài.
  2. Bắt đầu ở mức 1: cài Continue, hỏi đáp và nhờ giải thích mã trong một dự án thử.
  3. Lên mức 2, 3 có kiểm soát: thử Aider hoặc Cline trên nhánh git riêng, duyệt từng lệnh, so kết quả với cách làm cũ trước khi dùng cho dự án thật.

Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.

Đọc tiếp: Bộ não cho AI Agent →

Câu hỏi thường gặp

Trợ lý code chạy AI Local có thay được Claude Code hay Codex không?

Cho việc nhỏ, rõ ràng thì dùng tốt: giải thích đoạn mã, viết hàm, viết kiểm thử, sửa lỗi trong vài tệp. Với việc lớn nhiều tệp, cần lập luận dài, model mở chạy trên máy phổ thông thường chưa bằng model lớn trên đám mây. Cách thực tế là kết hợp: mã nhạy cảm và việc nhỏ dùng local, việc khó dùng đám mây.

Máy cấu hình thế nào thì chạy được model code?

Tài liệu Cline gợi ý 16–32GB RAM cho model nhỏ hoặc đã lượng tử hoá, 32–64GB cho model code cỡ vừa, từ 64GB cho model lớn và context dài. Ví dụ dung lượng tải trên Ollama: gpt-oss:20b khoảng 14GB, devstral:24b khoảng 14GB, qwen3-coder:30b khoảng 19GB. Cần thêm bộ nhớ cho context.

Có nên bật chế độ tự duyệt mọi lệnh cho nhanh?

Không nên, nhất là trên máy có dữ liệu thật. Tài liệu Cline ghi chế độ YOLO tắt mọi kiểm tra an toàn và có thể xoá tệp quan trọng mà không cảnh báo. Hãy duyệt từng lệnh, làm trong thư mục dự án riêng và luôn có git hoặc bản sao lưu để quay lại.

Model code mở có dùng cho dự án thương mại được không?

Các model code nêu trong bài như Qwen3-Coder, Devstral bản 24B, gpt-oss đều dùng giấy phép Apache-2.0, cho phép dùng thương mại. Riêng Devstral 2 bản 123B dùng giấy phép MIT có sửa đổi. Luôn đọc giấy phép trên model card trước khi dùng cho kinh doanh.

Vì sao trợ lý code local hay "quên" nội dung tệp đã đọc?

Thường do context quá ngắn. Ollama mặc định chỉ 4k token khi máy có dưới 24 GiB VRAM, và tài liệu Aider cảnh báo Ollama lặng lẽ bỏ phần vượt quá. Với lập trình, tài liệu Ollama khuyên đặt ít nhất 64.000 token nếu máy đủ bộ nhớ.

Tài liệu liên quan

Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local – Nguyễn Đức, Aduca
Bước tiếp theo

Đăng ký Tư vấn 1-1 về AI Local

Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.

Về AducaChuỗi bài do đội ngũ Aduca biên soạn từ kinh nghiệm đào tạo và triển khai AI Agent cho Marketing – Sales. Aduca Academy do Nguyễn Đức – Chủ tịch Aduca Group sáng lập; ông kinh doanh thương mại điện tử từ 2012, chạy quảng cáo Facebook từ 2014 và đào tạo từ 2016. Phần thực hành từng bước nằm trong các thư mục OpenClaw, Hermes Agent, Claude, ChatGPT và n8n.

Nguồn tham khảo

Lịch sử cập nhật

Miễn trừ trách nhiệm

Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.