Hiểu và dùng AI Local · Bài 2

Cấu hình máy tính chạy AI Local: RAM, VRAM, Mac hay PC NVIDIA

Chạy AI ngay trên máy của mình không đòi máy đắt nhất, nhưng đòi đúng loại bộ nhớ và đủ dung lượng. Bài viết giải thích RAM, VRAM, lượng tử hoá, bộ nhớ cho context và cách tự ước tính model nào vừa máy, tổng hợp từ tài liệu chính thức kiểm tra ngày 07/10/2026.

Cập nhật 07/10/2026⏱ 11 phút đọcKiến thức nềnNgười mới → Trung cấp

Mua máy mới rồi mới biết model không chạy nổi

Anh Phong, chủ một công ty dịch vụ kế toán nhỏ, muốn cho nhân viên tóm tắt hồ sơ khách bằng AI mà không gửi dữ liệu ra ngoài. Anh mua một máy tính xách tay cấu hình "mạnh" theo lời quảng cáo, tải model về thì máy chạy ì ạch, quạt kêu to, câu trả lời ra từng chữ. Hoá ra máy có CPU tốt nhưng card đồ hoạ chỉ có ít bộ nhớ, và model anh chọn lớn hơn phần bộ nhớ đó. (Tình huống minh hoạ.)

Với AI Local, câu hỏi đầu tiên là "máy có bao nhiêu bộ nhớ mà model dùng được". Nếu chưa rõ AI Local là gì, đọc trước AI Local là gì.

Cấu hình máy tính chạy AI Local phụ thuộc vào điều gì?

Cấu hình máy tính chạy AI Local chủ yếu do bộ nhớ quyết định: file model cộng phần bộ nhớ cho context phải nằm gọn trong VRAM của card đồ hoạ, hoặc trong RAM hợp nhất trên Mac Apple Silicon, thì model mới chạy trơn tru.

Tài liệu llama.cpp ghi rõ: yêu cầu bộ nhớ và ổ đĩa của một model là như nhau, tức file nặng bao nhiêu thì cần chừng ấy bộ nhớ để nạp. Khi model không vừa GPU, Ollama tự chia một phần sang CPU; lệnh ollama ps sẽ hiện tỷ lệ kiểu "48%/52% CPU/GPU" và tốc độ giảm rõ rệt.

So sánh bộ nhớ khi chạy AI Local: Mac Apple Silicon có một khối RAM hợp nhất dùng chung cho CPU và GPU, chứa hệ điều hành, file model Q4, KV cache cho context và phần còn trống; PC có card NVIDIA chứa file model và KV cache trong VRAM trên card, model lớn hơn VRAM thì tràn sang RAM hệ thống, chia cho CPU nên chạy chậm hơn, kiểm tra bằng lệnh ollama ps
Hình: File model và KV cache phải nằm gọn trong bộ nhớ dùng được (minh hoạ)

Nguồn: llama.cpp – Quantize · Ollama FAQ

Lượng tử hoá Q4, Q8 và công thức ước tính dung lượng

Lượng tử hoá là cách lưu mỗi tham số bằng ít bit hơn bản gốc, giống nén ảnh: file nhỏ đi nhiều, đổi lại mất bớt chi tiết. Bản gốc 16-bit tốn khoảng 2 byte cho mỗi tham số; NVIDIA lấy ví dụ model 7B ở 16-bit cần khoảng 14GB. Bảng đo của llama.cpp trên model Llama-3.1-8B:

Mức lượng tửBit cho mỗi tham sốDung lượng bản 8B
Q3_K_M3,9963,74 GiB
Q4_K_M4,8944,58 GiB
Q6_K6,5636,14 GiB
Q8_08,5017,95 GiB
F16 (bản gốc 16-bit)16,014,96 GiB

Từ bảng này có công thức ước tính: dung lượng (GB) ≈ số tỷ tham số × số bit ÷ 8. Quy ra cho mỗi 1 tỷ tham số:

Công thức khớp số llama.cpp công bố (model 70B ở Q4_K_M nặng 43,1GB, công thức cho 42,8GB). (Ví dụ minh hoạ) Model 27B ở Q4 ước tính khoảng 16,5GB; file thật qwen3.8:27b trên Ollama là 18GB, bản q8_0 30GB, bản bf16 56GB. File thật nặng hơn một chút vì có thêm phần xử lý hình ảnh và lớp nhúng, nên ưu tiên xem dung lượng ghi trên trang tag của ollama.com.

Tag ngắn của nhiều model trên Ollama là bản nén khoảng 4-bit (ví dụ qwen3.8, tức qwen3.8:27b, nặng 18GB, bằng bản q4_K_M). Theo llama.cpp, trên cùng một máy bản lượng tử thấp sinh chữ nhanh hơn bản 16-bit. Chọn Q8 khi máy dư bộ nhớ; chọn Q4 khi cần vừa máy.

Model kiểu MoE (chỉ kích hoạt một phần tham số mỗi lần) chạy nhanh hơn nhưng vẫn cần bộ nhớ cho toàn bộ tham số. Ví dụ bản q4_K_M của Gemma 4 26B (MoE 25,2B tổng, 3,8B kích hoạt) nặng 18GB, gần bằng bản q4_K_M của Gemma 4 31B (dense 30,7B) nặng 20GB. Đừng tính bộ nhớ theo số tham số kích hoạt.

Nguồn: llama.cpp – Quantize · NVIDIA – LLM inference · Ollama – qwen3.8 · Ollama – gemma4 tags · Gemma 4 model card

Bộ nhớ cho context (KV cache): phần hay bị quên

Context là lượng chữ model "nhìn thấy" cùng lúc: chỉ dẫn, lịch sử trò chuyện, tài liệu bạn dán vào. Để giữ context, model cần thêm bộ nhớ gọi là KV cache. Theo công thức của NVIDIA, Llama 2 7B ở 16-bit, context 4.096 token, một người dùng cần khoảng 2GB. Context dài hơn hoặc nhiều người dùng song song thì KV cache tăng theo tỷ lệ.

Model mới (Qwen3.5 trở đi, Gemma 4, DeepSeek V4) có KV cache nhỏ hơn nhiều so với công thức cổ điển; chưa có số chính thức cho từng model, nên hãy chạy thử rồi xem bằng ollama ps.

Bộ nhớ GPU (VRAM)Context Ollama tự đặt
Dưới 24 GiB4k token
24–48 GiB32k token
Từ 48 GiB trở lên256k token

Tài liệu Ollama khuyên đặt ít nhất 64.000 token cho việc làm agent, tìm web, lập trình, và lưu ý context lớn tốn thêm VRAM. Open WebUI cũng cảnh báo: với context mặc định 4.096 trên GPU dưới 24GB, dữ liệu truy xuất từ kho tài liệu có thể không được dùng tới; nên tăng lên từ 8.192, tốt hơn là trên 16.000. Nghĩa là máy 16GB chạy vừa model 9GB vẫn có thể hụt bộ nhớ khi bạn mở context dài.

Lệnh trên máy tính của bạnChạy trên máy đã cài Ollama; trong phiên chat có thể gõ /set parameter num_ctx <số>
ollama ps                                  # model đang chạy: kích thước, PROCESSOR, CONTEXT
OLLAMA_CONTEXT_LENGTH=64000 ollama serve   # chạy server với context 64k (macOS, Linux)

Nguồn: NVIDIA – KV cache · Ollama – Context length · Open WebUI – RAG

Bốn bước tự ước tính máy có chạy được model không

  1. Chọn model và mức lượng tửVí dụ bản 4-bit mặc định trên Ollama
  2. Xem dung lượng fileTrên trang tag ollama.com, hoặc ước tính số tỷ × bit ÷ 8
  3. Cộng phần cho contextViệc dài, agent, tài liệu cần context lớn hơn
  4. So với bộ nhớ dùng đượcVRAM của card, hoặc RAM hợp nhất của Mac, trừ phần hệ điều hành
  5. Chạy thử, xem ollama psChạy hết trên GPU là ổn; bị chia CPU/GPU thì chọn model nhỏ hơn
Quy trình ước tính trước khi tải model hoặc mua máy (ví dụ minh hoạ).

Nguyên tắc chung: dung lượng file model phải nhỏ hơn rõ rệt so với RAM (Mac) hoặc VRAM (PC NVIDIA), để còn chỗ cho context và hệ điều hành.

Mac Apple Silicon, PC NVIDIA, máy chỉ có CPU, card AMD/Intel

Loại máyBộ nhớ dành cho modelPhần mềm hỗ trợ (theo tài liệu)Điểm cần biết
Mac Apple Silicon (chip M)RAM hợp nhất, CPU và GPU dùng chungOllama (Metal, MLX), LM Studio (GGUF, MLX), llama.cpp, MLX-LM, JanKhông phải toàn bộ RAM dành cho GPU; Mac Intel không chạy LM Studio, Ollama chỉ chạy CPU
PC có card NVIDIAVRAM trên card (8–32GB với dòng GeForce phổ biến)Ollama, LM Studio, llama.cpp (CUDA), vLLM, JanModel vượt VRAM bị chia sang CPU và chậm hẳn
Máy chỉ có CPURAM thườngllama.cpp, Ollama (chạy CPU), LM Studio (x64 cần CPU có AVX2)Chạy được model nhỏ để thử; chưa có số tốc độ chính thức
Card AMD, IntelVRAM trên cardOllama (ROCm, Vulkan thử nghiệm), llama.cpp (HIP, Vulkan, SYCL), vLLM, JanDanh sách card hỗ trợ hẹp hơn; kiểm tra trước khi mua

Mac Apple Silicon: bộ nhớ hợp nhất

Apple mô tả kiến trúc bộ nhớ hợp nhất là gom bộ nhớ băng thông cao vào một khối chung, để các thành phần của chip truy cập cùng dữ liệu mà không phải chép qua lại. Vì vậy một Mac 64GB có thể nạp model lớn hơn PC có card 24GB VRAM.

Dành cho người dùng nâng cao. README của MLX-LM ghi: model vừa RAM mà chạy chậm thì có thể tăng giới hạn bộ nhớ "wired" bằng lệnh sudo sysctl iogpu.wired_limit_mb=N, với N (MB) lớn hơn dung lượng model nhưng nhỏ hơn tổng RAM; cần macOS 15 trở lên. Đây là lệnh quyền quản trị, đổi thiết lập hệ thống: người mới không cần làm; nếu làm, để dư nhiều cho hệ điều hành.

Ollama cần macOS 14 trở lên; từ bản v0.40.0 (25/09/2026) tự chạy bằng MLX với model được hỗ trợ như qwen3.8, gemma4. LM Studio chỉ chạy trên Mac chip M, khuyên từ 16GB RAM. Chưa có số tốc độ chính thức theo từng đời chip M; hãy chạy thử trên chính máy của bạn.

PC có card NVIDIA: nhìn VRAM của card

VRAM theo trang so sánh của NVIDIA: RTX 5090 32GB; RTX 4090 và RTX 3090 24GB; RTX 5080, 5070 Ti, 4080 SUPER 16GB; RTX 5070, 4070 SUPER 12GB; RTX 5060 Ti và 4060 Ti có bản 16GB hoặc 8GB; RTX 3060 có bản 12GB hoặc 8GB; RTX 5060 8GB. Card cùng tên có thể khác VRAM, hãy đọc kỹ thông số.

Ollama hỗ trợ card NVIDIA có compute capability 5.0 trở lên với driver 550 trở lên (card đời cũ 5.0–6.2 cần driver 570); trên Windows cần driver 551.61 trở lên. RAM hệ thống 64GB không thay được VRAM: phần model tràn ra RAM sẽ do CPU xử lý. Card mạnh cũng tốn điện, ví dụ RTX 5090 có tổng công suất đồ hoạ 575W; cách tính tiền điện ở Chi phí thật và bảo mật khi dùng AI Local.

Máy chỉ có CPU, card AMD hoặc Intel

llama.cpp chạy được chỉ bằng CPU; Ollama trên máy không có GPU thì cột PROCESSOR của ollama ps báo chạy hoàn toàn bằng CPU. README của Jan (phần macOS) ghi mức tham khảo khoảng 8GB RAM cho model 3B, 16GB cho 7B, 32GB cho 13B. Chưa có số tốc độ chính thức cho máy chỉ có CPU, nên hãy coi đây là cách làm quen và chạy model nhỏ.

Với card AMD: Ollama hỗ trợ nhiều dòng Radeon trên Linux, còn trên Windows chỉ một số card như Radeon RX 7900 XTX, 7600 và Radeon PRO W7900 đến W7500 (cần driver ROCm v7/HIP7). Nhánh Vulkan của Ollama (đang thử nghiệm) mở thêm cho GPU Intel và AMD; llama.cpp có HIP, Vulkan, SYCL. Hãy đối chiếu đúng tên card với trang GPU của Ollama trước khi mua.

Nguồn: Apple – Unified memory · MLX-LM · Ollama – macOS · Ollama v0.40.0 · LM Studio – System requirements · NVIDIA – Compare · Ollama – GPU · NVIDIA – RTX 5090 · llama.cpp · Jan

Bảng mức máy và cỡ model chạy được (ước tính)

Bảng dưới do Aduca ghép từ dung lượng file chính thức trên các trang tag của ollama.com (kiểm tra 07/10/2026). Đây là ước tính để định hướng, không phải số đo thực tế trên từng máy. Tên model và giấy phép chi tiết xem ở Bản đồ model AI mở 2026.

Mức máyVí dụ model vừa (dung lượng file trên Ollama)Ghi chú
Máy 8GB RAM, card 8GB VRAMqwen3.5:0.8b 1,2–1,3GB; qwen3.5:2b 2,7–3,1GB; qwen3.5:4b 3,3–4,0GB; phi4-mini 2,5GB; ministral-3:3b 3,0GB; gemma4:e2b-it-qat 4,3GBLM Studio: máy 8GB chạy được model nhỏ
16GB RAM, card 12–16GB VRAMqwen3.5:9b 6,6–7,6GB; gemma4:e4b 6,6–9,5GB; gemma4:12b 7,7–8,0GB; ministral-3:8b 6,0GB; ministral-3:14b 9,1GBgpt-oss:20b (14GB) chỉ hợp khi trống đủ 16GB; model card ghi chạy trong 16GB bộ nhớ
Mac 24–36GB; RTX 3090, 4090 (24GB); RTX 5090 (32GB)gemma4:26b 16–19GB; qwen3.8:27b 18GB; qwen3.6:27b 18–19GB; gemma4:31b 19–20GB; glm-4.7-flash 19GB; qwen3.6:35b 23–24GB (sát card 24GB)Ollama tự đặt context 32k khi VRAM 24–48GiB
64GB (thường là Mac)Bản Q8 của các model khoảng 30B: gemma4:26b-a4b-it-q8_0 28GB, qwen3.8:27b-q8_0 30GB, glm-4.7-flash:q8_0 32GB, gemma4:31b-it-q8_0 34GB; qwen3-coder-next q4 52GB (sát)Còn chỗ cho context dài hơn
128GB trở lêngpt-oss:120b 65GB; llama4:scout q4 67GB; qwen3.5:122b 81GB; qwen3-coder-next:q8_0 85GB; Mistral Small 4 khoảng 73GB ở Q4 (ước tính, chưa thấy tag Ollama)gpt-oss-120b vừa một GPU 80GB theo model card
256GB trở lênGLM-5.3-Flash (320B tổng) khoảng 196GB ở Q4 (ước tính)Máy trạm, máy chủ
Ngoài tầm máy cá nhânDeepSeek-V4.1-Flash khoảng 466GB ở Q4 (ước tính); Llama 4 Maverick q4 245GBDùng qua API hoặc máy chủ nhiều GPU
Bậc thang ước tính mức máy và cỡ model AI Local theo dung lượng file trên ollama.com: 8GB chạy qwen3.5:4b, phi4-mini, ministral-3:3b; 16GB chạy qwen3.5:9b, gemma4:12b, ministral-3:14b; Mac 24–36GB hoặc RTX 24–32GB chạy qwen3.8:27b, gemma4:31b, qwen3.6:35b; Mac 64GB chạy bản Q8 khoảng 30B và qwen3-coder-next; 128GB trở lên chạy gpt-oss:120b, llama4:scout, qwen3.5:122b
Hình: Mức máy và cỡ model vừa, ước tính theo dung lượng file (minh hoạ)

Nguồn: Ollama – qwen3.5 · Ollama – gemma4 · Ollama – gpt-oss · gpt-oss-20b model card · Ollama – llama4 · Ollama – qwen3-coder-next · Mistral Small 4 · GLM-5.3-Flash · DeepSeek-V4.1-Flash

Ổ cứng: model nặng từ vài GB đến hàng trăm GB

Tài liệu Ollama ghi model có thể nặng "từ hàng chục đến hàng trăm GB"; riêng phần cài Ollama trên Windows cần tối thiểu 4GB. Vài ví dụ: gemma4:31b-it-bf16 63GB, qwen3.5:122b 81GB, llama4 bản maverick q4 245GB.

Nguồn: Ollama – Windows · Ollama – macOS · Ollama FAQ · Ollama – gemma4

Dùng máy có sẵn, mua máy mới hay thuê GPU theo giờ?

1. Dùng máy đang có: thử trước, chưa tốn tiền

Cài Ollama hoặc LM Studio (xem Cài AI Local trong 30 phút), tải một model nhỏ, chat thử và xem model chạy trên GPU hay bị chia sang CPU:

Lệnh trên máy tính của bạnChạy trên máy đã cài Ollama
ollama pull qwen3.5:4b    # model nhỏ, file khoảng 3,3–4,0GB
ollama run qwen3.5:4b     # chat thử, gõ /bye để thoát
ollama ps                 # xem model chạy trên GPU hay bị chia sang CPU

Model nhỏ đã đủ cho việc của bạn thì chưa cần nâng cấp.

2. Mua máy mới: chọn theo bộ nhớ, không theo quảng cáo

3. Thuê GPU theo giờ: thử model lớn hoặc chạy theo đợt

Card (RunPod, 10/2026)Community ($/giờ)Secure ($/giờ)
RTX 40900,340,74
RTX 50900,690,99
L40S0,791,09
A100 80GB PCIe1,191,59
H100 SXM2,693,49

Giá thay đổi liên tục. Chạy cả tháng thì nhân giá giờ với khoảng 730 giờ. (Ví dụ minh hoạ) RTX 4090 gói Community: 0,34 × 730 ≈ 248 USD/tháng; gói Secure: 0,74 × 730 ≈ 540 USD/tháng.

Máy thuê nằm ở trung tâm dữ liệu của nhà cung cấp, không còn là "dữ liệu ở lại máy mình". Đọc điều khoản và chính sách dữ liệu trước khi đưa hồ sơ khách lên; với dữ liệu nhạy cảm, ưu tiên máy của bạn.

Nguồn: RunPod – Pricing · vLLM – GPU

Bắt đầu từ đâu?

Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.

Đọc tiếp: Bản đồ model mở →

Câu hỏi thường gặp

Máy 8GB RAM có chạy được AI Local không?

Được, với model nhỏ. LM Studio ghi máy 8GB chỉ chạy được model nhỏ, còn Jan ghi khoảng 8GB RAM cho model 3B. Các model có file khoảng 1–4GB trên ollama.com như qwen3.5:2b, qwen3.5:4b, ministral-3:3b là lựa chọn để thử. Máy 8GB hợp để làm quen, tóm tắt ngắn, phân loại; việc viết dài hoặc chatbot có kho kiến thức cần máy nhiều bộ nhớ hơn.

Nên mua Mac hay PC có card NVIDIA để chạy AI Local?

Tuỳ cỡ model bạn cần. Mac Apple Silicon dùng bộ nhớ hợp nhất nên một máy nhiều RAM nạp được model lớn hơn card rời. PC NVIDIA hợp khi model vừa gọn VRAM của card và khi cần phần mềm phục vụ nhiều người như vLLM trên Linux. Hãy chọn model trước (bài Bản đồ model mở), rồi mới chọn máy có bộ nhớ dư ra cho context.

Vì sao model vừa đủ RAM mà vẫn chạy chậm?

Có ba lý do thường gặp: model lớn hơn VRAM nên Ollama chia một phần sang CPU; context đặt quá dài làm KV cache phình ra; hoặc máy còn chạy nhiều ứng dụng khác. Lệnh ollama ps cho biết model đang chạy hết trên GPU hay chia tỷ lệ CPU/GPU, kèm độ dài context đang dùng.

Q4 và Q8 khác nhau thế nào, nên chọn mức nào?

Đó là mức lượng tử hoá: số bit dùng để lưu mỗi tham số. Theo bảng của llama.cpp, Q4_K_M khoảng 4,9 bit, Q8_0 khoảng 8,5 bit, nên file Q8 lớn khoảng 1,7 lần Q4. Bản 4-bit là mặc định của nhiều tag trên Ollama và hợp đa số máy; bản Q8 dùng khi máy dư bộ nhớ và bạn muốn giữ nhiều chi tiết hơn.

Có nên thuê GPU theo giờ thay vì mua máy?

Thuê hợp khi bạn muốn thử model lớn trước khi mua, chạy việc theo đợt, hoặc cần card nhiều VRAM trong thời gian ngắn. Chạy 24/7 cả tháng thì nhân giá giờ với khoảng 730 giờ để so với chi phí mua máy. Lưu ý máy thuê nằm ở trung tâm dữ liệu của nhà cung cấp, nên cần đọc điều khoản trước khi đưa dữ liệu nhạy cảm lên.

Tài liệu liên quan

Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local – Nguyễn Đức, Aduca
Bước tiếp theo

Đăng ký Tư vấn 1-1 về AI Local

Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.

Về AducaChuỗi bài do đội ngũ Aduca biên soạn từ kinh nghiệm đào tạo và triển khai AI Agent cho Marketing – Sales. Aduca Academy do Nguyễn Đức – Chủ tịch Aduca Group sáng lập; ông kinh doanh thương mại điện tử từ 2012, chạy quảng cáo Facebook từ 2014 và đào tạo từ 2016. Phần thực hành từng bước nằm trong các thư mục OpenClaw, Hermes Agent, Claude, ChatGPT và n8n.

Nguồn tham khảo

Lịch sử cập nhật

Miễn trừ trách nhiệm

Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.