Hiểu và dùng AI Local · Bài 9

AI Local làm slide, tài liệu, Excel và hỏi đáp tài liệu nội bộ

Quy trình, hợp đồng mẫu, bảng giá nội bộ, số liệu bán hàng là loại dữ liệu nhiều doanh nghiệp không muốn gửi lên dịch vụ AI bên ngoài. Bài viết giới thiệu bốn việc văn phòng làm được với model chạy trên máy, công cụ phù hợp và giới hạn của từng cách, tổng hợp từ tài liệu chính thức tại ngày 07/10/2026.

Cập nhật 07/10/2026⏱ 8 phút đọcKiến thức nềnNgười mới → Trung cấp

Câu hỏi lặp lại mỗi ngày, tài liệu thì không muốn gửi ra ngoài

Anh Tùng làm trưởng phòng vận hành ở một công ty phân phối thiết bị. Mỗi tuần anh nhận hàng chục câu hỏi giống nhau: quy trình đổi trả gồm mấy bước, mẫu hợp đồng đại lý mới nhất là bản nào, chiết khấu cấp hai tính ra sao. Câu trả lời đều nằm trong thư mục tài liệu nội bộ, thứ công ty không muốn tải lên dịch vụ AI bên ngoài. (Tình huống minh hoạ.)

Sơ đồ hỏi đáp tài liệu nội bộ bằng AI Local: các tài liệu quy trình, bảng giá nội bộ, hợp đồng mẫu được đưa vào kho kiến thức, cắt đoạn và đánh chỉ mục; model chạy trên máy tra đoạn liên quan rồi trả lời câu hỏi về quy trình đổi trả kèm tên tài liệu nguồn; dùng Open WebUI, AnythingLLM hoặc LM Studio, tài liệu không rời máy
Hình: Hỏi đáp tài liệu nội bộ, tra đoạn liên quan rồi trả lời kèm nguồn (minh hoạ)

Bài này đi qua bốn việc văn phòng làm được với AI Local. Chưa cài công cụ nào, xem Cài AI Local trong 30 phút.

Hỏi đáp tài liệu nội bộ bằng AI Local là gì?

Hỏi đáp tài liệu nội bộ bằng AI Local là đưa tài liệu của doanh nghiệp vào một kho kiến thức trên máy, để model chạy local tìm đúng đoạn liên quan rồi trả lời câu hỏi của nhân viên, kèm tên tài liệu nguồn.

Cách làm này thường gọi là RAG (truy xuất rồi trả lời). Hình dung như một nhân viên mới có tủ hồ sơ: khi được hỏi, họ rút đúng vài trang liên quan, đọc rồi mới trả lời. "Tủ hồ sơ" là tài liệu đã cắt thành đoạn nhỏ, đánh chỉ mục bằng một model nhúng (embedding), loại model biến chữ thành dãy số để tìm theo ý nghĩa. Cách chọn model nhúng ở Bản đồ model AI mở 2026.

  1. Tải tài liệuQuy trình, hợp đồng mẫu, bảng giá, câu hỏi thường gặp
  2. Cắt đoạn, đánh chỉ mụcCông cụ tự làm bằng model nhúng
  3. Nhân viên đặt câu hỏiTrong khung chat trên máy hoặc trong mạng nội bộ
  4. Tra đoạn liên quanLấy vài đoạn gần nghĩa nhất với câu hỏi
  5. Model local trả lờiChỉ dựa trên đoạn tìm được, ghi tên tài liệu nguồn
Luồng hỏi đáp tài liệu nội bộ (ví dụ minh hoạ).

Việc 1: hỏi đáp tài liệu nội bộ

Công cụCách dùng kho tài liệuĐiểm cần biết
Open WebUIMục Knowledge: gọi bằng # trong khung chat hoặc gắn cố định vào một model. Hai chế độ: Focused Retrieval (mặc định, lấy đoạn liên quan) và Full Context (đưa cả tài liệu)Giao diện tự host cho cả nhóm; giấy phép giữ thương hiệu từ bản 0.6.6
AnythingLLM (MIT)Workspace chứa tài liệu để chat cùng; widget nhúng web (bản Docker) có chế độ Query chỉ trả lời từ tài liệuDesktop dành cho một người; nhiều người dùng cần bản Docker. Có telemetry ẩn danh, tắt bằng DISABLE_TELEMETRY=true hoặc trong cài đặt
LM StudioĐính kèm .docx, .pdf, .txt vào cuộc chat. Tệp ngắn được đưa nguyên văn, tệp dài dùng RAGLàm việc một mình; xử lý tài liệu hoàn toàn trên máy

Gắn cho trợ lý một chỉ dẫn rõ ràng để nó không đoán khi tài liệu không có thông tin (ví dụ minh hoạ):

Chỉ dẫn cho trợ lý hỏi đáp nội bộCopy rồi dán vào prompt hệ thống của model hoặc workspace; thay phần trong <…>
Bạn là trợ lý tra cứu tài liệu nội bộ của <tên công ty>.
Chỉ trả lời dựa trên tài liệu được cung cấp. Nếu tài liệu không có thông tin, trả lời:
"Tài liệu hiện có chưa nêu nội dung này, bạn hỏi <bộ phận phụ trách> nhé."
Mỗi câu trả lời ghi tên tài liệu nguồn ở cuối. Không suy đoán số tiền, thời hạn, điều khoản.
Với Ollama trên máy có VRAM dưới 24GB, độ dài ngữ cảnh mặc định là 4096 token. Tài liệu Open WebUI cảnh báo khi đó đoạn tài liệu truy xuất có thể không được dùng tới, và khuyên tăng lên 8192 trở lên. Ngữ cảnh lớn hơn tốn thêm bộ nhớ.

Nguồn: Open WebUI Knowledge · Open WebUI RAG · AnythingLLM Desktop · AnythingLLM Chat modes · AnythingLLM GitHub · LM Studio RAG · Ollama Context length

Việc 2: tóm tắt PDF, Word

Đây là việc dễ bắt đầu nhất: kéo tệp vào khung chat và yêu cầu tóm tắt. Một số điểm giúp kết quả đáng tin hơn:

Mẫu: tóm tắt tài liệuCopy rồi dán vào khung chat sau khi đính kèm tệp; thay phần trong <…>
Tóm tắt tài liệu đính kèm cho <người đọc: ví dụ trưởng phòng kinh doanh>:
1. Ba ý chính, mỗi ý một câu.
2. Các con số, mốc thời gian quan trọng, ghi số trang nếu có.
3. Việc cần làm hoặc quyết định cần đưa ra.
Chỉ dùng nội dung trong tài liệu; chỗ nào không chắc thì ghi [CẦN KIỂM TRA].

Lệnh chạy Apache Tika bằng Docker theo tài liệu Open WebUI; sau đó cấu hình Open WebUI dùng Tika theo hướng dẫn trên cùng trang:

Lệnh trên máy tính của bạnChạy trên máy đã cài Docker, cùng máy với Open WebUI
docker run -d -p 9998:9998 apache/tika:latest-full

Nguồn: Open WebUI Document extraction · Apache Tika · Docling · AnythingLLM – loại tệp hỗ trợ

Việc 3: làm slide

Model local tự nó không xuất ra file PowerPoint. Cần thêm một công cụ chuyển nội dung thành slide. Ba hướng có tài liệu chính thức:

Công cụCách làmGiấy phépLưu ý
MarpModel viết Markdown, Marp CLI xuất HTML, PDF, PPTX, ảnh PNGMITPPTX mặc định là ảnh nền nên không sửa được chữ; tuỳ chọn --pptx-editable còn thử nghiệm, cần LibreOffice. Máy cần Chrome, Edge hoặc Firefox
PresentonỨng dụng tạo slide bằng AI; chạy bằng Docker hoặc ứng dụng máy tính, nối Ollama, LM StudioApache-2.0Xuất PPTX và PDF. Ảnh minh hoạ lấy từ Pexels, Pixabay (cần khoá API, có kết nối mạng) hoặc ComfyUI tự host. Dàn ý mỗi slide mặc định tối đa 100 từ
AnythingLLMAgent Document Generation (từ bản 1.12.0) tạo PowerPoint, Excel, DOCX, PDFMITPhải bật trong Settings → Agent Skills. Tài liệu khuyến nghị model từ 8B trở lên cho PowerPoint; cần model hỗ trợ gọi công cụ

Cách nhanh với Marp: cho model viết nội dung theo mẫu dưới, lưu thành slide.md, rồi xuất file.

Mẫu: nội dung slide cho MarpCopy rồi dán vào khung chat model local; thay phần trong <…>
Viết nội dung slide dạng Markdown cho Marp về chủ đề: <chủ đề>, dành cho <người nghe>.
- Mỗi slide cách nhau bằng một dòng chỉ có ba dấu gạch ngang.
- 8 đến 10 slide, mỗi slide một tiêu đề và tối đa 4 gạch đầu dòng ngắn.
- Chỉ dùng số liệu trong phần dữ liệu sau: <dán dữ liệu>
Lệnh trên máy tính của bạnChạy trong thư mục chứa slide.md; máy cần Node.js và một trình duyệt Chrome, Edge hoặc Firefox
npx @marp-team/marp-cli@latest slide.md --pptx
npx @marp-team/marp-cli@latest slide.md --pdf

Với Presenton, model gợi ý trong README không hỗ trợ tiếng Việt chính thức; hãy đổi sang model đa ngôn ngữ đã tự thử (xem AI Local viết content).

Bốn việc văn phòng AI Local làm được quanh một model chạy trên máy: hỏi đáp tài liệu với Open WebUI Knowledge, AnythingLLM, LM Studio trả lời kèm nguồn; tóm tắt PDF, Word, PDF scan cần bật OCR; làm slide bằng Marp chuyển Markdown thành slide hoặc Presenton tạo slide bằng AI; phân tích bảng bằng cách lưu CSV rồi để AI viết và chạy Python, đối chiếu lại số liệu
Hình: Bốn việc văn phòng với AI Local, mỗi việc một công cụ (minh hoạ)

Nguồn: Marp · Marp CLI · Marp CLI README · Presenton · Presenton Docs · AnythingLLM Document Generation

Việc 4: phân tích bảng số liệu, Excel

Model ngôn ngữ đọc bảng dài có thể tính sai. Cách chắc chắn hơn là để AI viết code Python rồi chạy code đó để tính. Open WebUI có ba cách chạy code: chạy tay bằng Pyodide (Python ngay trong trình duyệt), Code Interpreter (AI tự viết và chạy code) và Open Terminal, cách được tài liệu khuyến nghị. Pyodide có sẵn pandas, numpy, matplotlib nhưng AI không cài thêm thư viện được; tệp tải lên nằm ở /mnt/uploads/, biểu đồ hiện ngay trong khung chat. Tài liệu ghi Pyodide và Jupyter đã thuộc nhóm "legacy".

Mẫu: phân tích bảng doanh sốCopy rồi dán vào khung chat có bật chạy code; thay phần trong <…>
Tệp doanh-so.csv gồm các cột: <ngày, chi nhánh, sản phẩm, số lượng, doanh thu>.
Dùng Python đọc tệp, rồi:
1. Tính tổng doanh thu theo tháng và theo chi nhánh.
2. Vẽ biểu đồ cột doanh thu theo tháng.
3. Nêu 3 nhận xét, mỗi nhận xét kèm con số đã tính.
In ra đoạn code đã chạy để tôi kiểm tra lại.

AnythingLLM cũng có agent (gọi bằng @agent) vẽ được biểu đồ và truy vấn SQL, với điều kiện model hỗ trợ gọi công cụ.

Nguồn: Open WebUI Python · AnythingLLM Agent

Lợi thế chính: dữ liệu không rời máy, nếu bạn giữ đúng cách

Theo tài liệu LM Studio, xử lý tài liệu diễn ra hoàn toàn trên máy, chỉ cần mạng khi tải model hoặc cập nhật. Ollama cũng ghi họ không thấy dữ liệu khi bạn chạy local. Nhưng dữ liệu vẫn có thể đi ra ngoài khi:

Chỉ đưa vào kho kiến thức dữ liệu cần thiết, phân quyền ai xem kho nào, theo tinh thần Luật Bảo vệ dữ liệu cá nhân 91/2025/QH15. Bảo mật đầy đủ ở Chi phí và bảo mật AI Local.

Nguồn: LM Studio Offline · Ollama FAQ

Giới hạn cần biết

Nguồn: AnythingLLM System requirements

Bắt đầu từ đâu?

  1. Chọn một bộ tài liệu nhỏ, ví dụ 10 đến 20 tệp quy trình và câu hỏi thường gặp của một phòng ban, đã được duyệt nội dung.
  2. Dựng thử trên một máy bằng LM Studio hoặc AnythingLLM Desktop, đặt chỉ dẫn "chỉ trả lời từ tài liệu", tăng độ dài ngữ cảnh.
  3. Kiểm thử bằng 20 câu hỏi thật mà phòng ban hay nhận, chấm đúng sai, rồi mới mở cho cả nhóm qua Open WebUI hoặc AnythingLLM bản Docker.

Muốn biến kho kiến thức thành chatbot trả lời khách, xem Chatbot bán hàng chạy AI Local. Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.

Đọc tiếp: AI Local cho lập trình →

Câu hỏi thường gặp

AI Local có đọc được file PDF, Word, Excel không?

Có, tuỳ công cụ. LM Studio đọc được .docx, .pdf, .txt. AnythingLLM đọc nhiều loại hơn như pdf, docx, pptx, xlsx, csv. Open WebUI mặc định trích chữ bằng pypdf và có thể chuyển sang Tika hoặc Docling để đọc PDF scan, ảnh chứa chữ. Với bảng số liệu cần tính toán, nên lưu thành CSV trước khi tải lên.

Hỏi đáp tài liệu nội bộ bằng AI Local có cần Internet không?

Chỉ cần mạng khi tải phần mềm, tải model và cập nhật. Theo tài liệu LM Studio, việc chat và xử lý tài liệu diễn ra hoàn toàn trên máy. Lưu ý nếu bạn nối thêm API đám mây hoặc dùng model có hậu tố cloud thì dữ liệu sẽ rời máy.

AI Local có làm được file PowerPoint không?

Có ba hướng. Marp biến Markdown do model viết thành slide và xuất PPTX, PDF, nhưng PPTX mặc định không sửa được chữ. Presenton tạo slide bằng AI, nối được Ollama, xuất PPTX và PDF. Agent Document Generation của AnythingLLM tạo được PowerPoint; tài liệu của họ khuyến nghị model từ 8B trở lên cho việc này.

Vì sao AI Local trả lời như không đọc tài liệu tôi đã tải lên?

Một nguyên nhân hay gặp: Ollama mặc định độ dài ngữ cảnh 4096 token trên máy có VRAM dưới 24GB, nên phần tài liệu truy xuất có thể không được dùng tới. Tài liệu Open WebUI khuyên tăng lên 8192 trở lên. Ngoài ra hãy kiểm tra tệp có phải PDF scan cần OCR không.

Nhân viên có thể dùng chung một hệ thống hỏi đáp nội bộ không?

Được. Open WebUI là giao diện tự host cho nhiều người, có kho kiến thức gắn vào model. AnythingLLM bản Docker hỗ trợ nhiều người dùng, còn bản Desktop dành cho một người. Máy chạy model nên đặt trong mạng nội bộ, không mở cổng ra Internet.

Tài liệu liên quan

Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local – Nguyễn Đức, Aduca
Bước tiếp theo

Đăng ký Tư vấn 1-1 về AI Local

Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.

Về AducaChuỗi bài do đội ngũ Aduca biên soạn từ kinh nghiệm đào tạo và triển khai AI Agent cho Marketing – Sales. Aduca Academy do Nguyễn Đức – Chủ tịch Aduca Group sáng lập; ông kinh doanh thương mại điện tử từ 2012, chạy quảng cáo Facebook từ 2014 và đào tạo từ 2016. Phần thực hành từng bước nằm trong các thư mục OpenClaw, Hermes Agent, Claude, ChatGPT và n8n.

Nguồn tham khảo

Lịch sử cập nhật

Miễn trừ trách nhiệm

Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.