AI Local làm slide, tài liệu, Excel và hỏi đáp tài liệu nội bộ
Quy trình, hợp đồng mẫu, bảng giá nội bộ, số liệu bán hàng là loại dữ liệu nhiều doanh nghiệp không muốn gửi lên dịch vụ AI bên ngoài. Bài viết giới thiệu bốn việc văn phòng làm được với model chạy trên máy, công cụ phù hợp và giới hạn của từng cách, tổng hợp từ tài liệu chính thức tại ngày 07/10/2026.
Câu hỏi lặp lại mỗi ngày, tài liệu thì không muốn gửi ra ngoài
Anh Tùng làm trưởng phòng vận hành ở một công ty phân phối thiết bị. Mỗi tuần anh nhận hàng chục câu hỏi giống nhau: quy trình đổi trả gồm mấy bước, mẫu hợp đồng đại lý mới nhất là bản nào, chiết khấu cấp hai tính ra sao. Câu trả lời đều nằm trong thư mục tài liệu nội bộ, thứ công ty không muốn tải lên dịch vụ AI bên ngoài. (Tình huống minh hoạ.)
Bài này đi qua bốn việc văn phòng làm được với AI Local. Chưa cài công cụ nào, xem Cài AI Local trong 30 phút.
Hỏi đáp tài liệu nội bộ bằng AI Local là gì?
Hỏi đáp tài liệu nội bộ bằng AI Local là đưa tài liệu của doanh nghiệp vào một kho kiến thức trên máy, để model chạy local tìm đúng đoạn liên quan rồi trả lời câu hỏi của nhân viên, kèm tên tài liệu nguồn.
Cách làm này thường gọi là RAG (truy xuất rồi trả lời). Hình dung như một nhân viên mới có tủ hồ sơ: khi được hỏi, họ rút đúng vài trang liên quan, đọc rồi mới trả lời. "Tủ hồ sơ" là tài liệu đã cắt thành đoạn nhỏ, đánh chỉ mục bằng một model nhúng (embedding), loại model biến chữ thành dãy số để tìm theo ý nghĩa. Cách chọn model nhúng ở Bản đồ model AI mở 2026.
- Tải tài liệuQuy trình, hợp đồng mẫu, bảng giá, câu hỏi thường gặp
- Cắt đoạn, đánh chỉ mụcCông cụ tự làm bằng model nhúng
- Nhân viên đặt câu hỏiTrong khung chat trên máy hoặc trong mạng nội bộ
- Tra đoạn liên quanLấy vài đoạn gần nghĩa nhất với câu hỏi
- Model local trả lờiChỉ dựa trên đoạn tìm được, ghi tên tài liệu nguồn
Việc 1: hỏi đáp tài liệu nội bộ
| Công cụ | Cách dùng kho tài liệu | Điểm cần biết |
|---|---|---|
| Open WebUI | Mục Knowledge: gọi bằng # trong khung chat hoặc gắn cố định vào một model. Hai chế độ: Focused Retrieval (mặc định, lấy đoạn liên quan) và Full Context (đưa cả tài liệu) | Giao diện tự host cho cả nhóm; giấy phép giữ thương hiệu từ bản 0.6.6 |
| AnythingLLM (MIT) | Workspace chứa tài liệu để chat cùng; widget nhúng web (bản Docker) có chế độ Query chỉ trả lời từ tài liệu | Desktop dành cho một người; nhiều người dùng cần bản Docker. Có telemetry ẩn danh, tắt bằng DISABLE_TELEMETRY=true hoặc trong cài đặt |
| LM Studio | Đính kèm .docx, .pdf, .txt vào cuộc chat. Tệp ngắn được đưa nguyên văn, tệp dài dùng RAG | Làm việc một mình; xử lý tài liệu hoàn toàn trên máy |
Gắn cho trợ lý một chỉ dẫn rõ ràng để nó không đoán khi tài liệu không có thông tin (ví dụ minh hoạ):
Bạn là trợ lý tra cứu tài liệu nội bộ của <tên công ty>.
Chỉ trả lời dựa trên tài liệu được cung cấp. Nếu tài liệu không có thông tin, trả lời:
"Tài liệu hiện có chưa nêu nội dung này, bạn hỏi <bộ phận phụ trách> nhé."
Mỗi câu trả lời ghi tên tài liệu nguồn ở cuối. Không suy đoán số tiền, thời hạn, điều khoản.Nguồn: Open WebUI Knowledge · Open WebUI RAG · AnythingLLM Desktop · AnythingLLM Chat modes · AnythingLLM GitHub · LM Studio RAG · Ollama Context length
Việc 2: tóm tắt PDF, Word
Đây là việc dễ bắt đầu nhất: kéo tệp vào khung chat và yêu cầu tóm tắt. Một số điểm giúp kết quả đáng tin hơn:
- Chọn đúng bộ đọc tệp. Open WebUI mặc định trích chữ bằng pypdf; có thể chuyển sang Apache Tika hoặc Docling (có OCR) để đọc PDF scan và ảnh chứa chữ. AnythingLLM đọc được pdf, docx, odt, epub, txt, md, pptx, xlsx, csv và nhiều loại khác.
- Yêu cầu có cấu trúc: ý chính, con số, việc cần làm, và đánh dấu chỗ không chắc.
- Người đọc lại bản gốc với mọi con số, điều khoản trước khi dùng để ra quyết định.
Tóm tắt tài liệu đính kèm cho <người đọc: ví dụ trưởng phòng kinh doanh>:
1. Ba ý chính, mỗi ý một câu.
2. Các con số, mốc thời gian quan trọng, ghi số trang nếu có.
3. Việc cần làm hoặc quyết định cần đưa ra.
Chỉ dùng nội dung trong tài liệu; chỗ nào không chắc thì ghi [CẦN KIỂM TRA].Lệnh chạy Apache Tika bằng Docker theo tài liệu Open WebUI; sau đó cấu hình Open WebUI dùng Tika theo hướng dẫn trên cùng trang:
docker run -d -p 9998:9998 apache/tika:latest-fullNguồn: Open WebUI Document extraction · Apache Tika · Docling · AnythingLLM – loại tệp hỗ trợ
Việc 3: làm slide
Model local tự nó không xuất ra file PowerPoint. Cần thêm một công cụ chuyển nội dung thành slide. Ba hướng có tài liệu chính thức:
| Công cụ | Cách làm | Giấy phép | Lưu ý |
|---|---|---|---|
| Marp | Model viết Markdown, Marp CLI xuất HTML, PDF, PPTX, ảnh PNG | MIT | PPTX mặc định là ảnh nền nên không sửa được chữ; tuỳ chọn --pptx-editable còn thử nghiệm, cần LibreOffice. Máy cần Chrome, Edge hoặc Firefox |
| Presenton | Ứng dụng tạo slide bằng AI; chạy bằng Docker hoặc ứng dụng máy tính, nối Ollama, LM Studio | Apache-2.0 | Xuất PPTX và PDF. Ảnh minh hoạ lấy từ Pexels, Pixabay (cần khoá API, có kết nối mạng) hoặc ComfyUI tự host. Dàn ý mỗi slide mặc định tối đa 100 từ |
| AnythingLLM | Agent Document Generation (từ bản 1.12.0) tạo PowerPoint, Excel, DOCX, PDF | MIT | Phải bật trong Settings → Agent Skills. Tài liệu khuyến nghị model từ 8B trở lên cho PowerPoint; cần model hỗ trợ gọi công cụ |
Cách nhanh với Marp: cho model viết nội dung theo mẫu dưới, lưu thành slide.md, rồi xuất file.
Viết nội dung slide dạng Markdown cho Marp về chủ đề: <chủ đề>, dành cho <người nghe>.
- Mỗi slide cách nhau bằng một dòng chỉ có ba dấu gạch ngang.
- 8 đến 10 slide, mỗi slide một tiêu đề và tối đa 4 gạch đầu dòng ngắn.
- Chỉ dùng số liệu trong phần dữ liệu sau: <dán dữ liệu>npx @marp-team/marp-cli@latest slide.md --pptx
npx @marp-team/marp-cli@latest slide.md --pdfVới Presenton, model gợi ý trong README không hỗ trợ tiếng Việt chính thức; hãy đổi sang model đa ngôn ngữ đã tự thử (xem AI Local viết content).
Nguồn: Marp · Marp CLI · Marp CLI README · Presenton · Presenton Docs · AnythingLLM Document Generation
Việc 4: phân tích bảng số liệu, Excel
Model ngôn ngữ đọc bảng dài có thể tính sai. Cách chắc chắn hơn là để AI viết code Python rồi chạy code đó để tính. Open WebUI có ba cách chạy code: chạy tay bằng Pyodide (Python ngay trong trình duyệt), Code Interpreter (AI tự viết và chạy code) và Open Terminal, cách được tài liệu khuyến nghị. Pyodide có sẵn pandas, numpy, matplotlib nhưng AI không cài thêm thư viện được; tệp tải lên nằm ở /mnt/uploads/, biểu đồ hiện ngay trong khung chat. Tài liệu ghi Pyodide và Jupyter đã thuộc nhóm "legacy".
- Lưu bảng thành CSV trước khi tải lên. Việc đọc trực tiếp .xlsx trong Pyodide chưa được tài liệu xác nhận.
- Bỏ cột không cần thiết như tên, số điện thoại khách trước khi phân tích.
- Đối chiếu vài con số quan trọng bằng hàm SUM, SUMIF hoặc bảng tổng hợp trong Excel.
Tệp doanh-so.csv gồm các cột: <ngày, chi nhánh, sản phẩm, số lượng, doanh thu>.
Dùng Python đọc tệp, rồi:
1. Tính tổng doanh thu theo tháng và theo chi nhánh.
2. Vẽ biểu đồ cột doanh thu theo tháng.
3. Nêu 3 nhận xét, mỗi nhận xét kèm con số đã tính.
In ra đoạn code đã chạy để tôi kiểm tra lại.AnythingLLM cũng có agent (gọi bằng @agent) vẽ được biểu đồ và truy vấn SQL, với điều kiện model hỗ trợ gọi công cụ.
Nguồn: Open WebUI Python · AnythingLLM Agent
Lợi thế chính: dữ liệu không rời máy, nếu bạn giữ đúng cách
Theo tài liệu LM Studio, xử lý tài liệu diễn ra hoàn toàn trên máy, chỉ cần mạng khi tải model hoặc cập nhật. Ollama cũng ghi họ không thấy dữ liệu khi bạn chạy local. Nhưng dữ liệu vẫn có thể đi ra ngoài khi:
- Dùng model có hậu tố
:cloudhoặc-cloudcủa Ollama; tắt hẳn bằngOLLAMA_NO_CLOUD=1. - Nối thêm API đám mây (OpenAI, Claude…) trong Open WebUI, AnythingLLM hoặc Presenton.
- Presenton lấy ảnh từ Pexels, Pixabay qua mạng.
- Mở cổng máy chạy model ra Internet. Ollama mặc định chỉ nghe ở
127.0.0.1:11434; truy cập từ xa nên đi qua VPN.
Chỉ đưa vào kho kiến thức dữ liệu cần thiết, phân quyền ai xem kho nào, theo tinh thần Luật Bảo vệ dữ liệu cá nhân 91/2025/QH15. Bảo mật đầy đủ ở Chi phí và bảo mật AI Local.
Nguồn: LM Studio Offline · Ollama FAQ
Giới hạn cần biết
- Trả lời có thể sai hoặc thiếu khi đoạn tra được không đúng chỗ. Yêu cầu ghi nguồn, mở tài liệu gốc khi cần chắc chắn.
- Máy quyết định trải nghiệm. AnythingLLM khuyến nghị RAM 16GB, CPU 8 nhân, máy Windows nên có GPU 8–12GB VRAM trở lên, và ghi rằng model thường là điểm nghẽn. Cách chọn máy ở Cấu hình máy chạy AI Local.
- Tài liệu cũ làm câu trả lời cũ. Cần một người phụ trách cập nhật kho kiến thức khi quy trình, bảng giá thay đổi.
- Slide và báo cáo vẫn cần người hoàn thiện. AI làm khung và bản nháp; bố cục, số liệu, thông điệp cuối do người chịu trách nhiệm.
Nguồn: AnythingLLM System requirements
Bắt đầu từ đâu?
- Chọn một bộ tài liệu nhỏ, ví dụ 10 đến 20 tệp quy trình và câu hỏi thường gặp của một phòng ban, đã được duyệt nội dung.
- Dựng thử trên một máy bằng LM Studio hoặc AnythingLLM Desktop, đặt chỉ dẫn "chỉ trả lời từ tài liệu", tăng độ dài ngữ cảnh.
- Kiểm thử bằng 20 câu hỏi thật mà phòng ban hay nhận, chấm đúng sai, rồi mới mở cho cả nhóm qua Open WebUI hoặc AnythingLLM bản Docker.
Muốn biến kho kiến thức thành chatbot trả lời khách, xem Chatbot bán hàng chạy AI Local. Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.
Đọc tiếp: AI Local cho lập trình →
Câu hỏi thường gặp
AI Local có đọc được file PDF, Word, Excel không?
Có, tuỳ công cụ. LM Studio đọc được .docx, .pdf, .txt. AnythingLLM đọc nhiều loại hơn như pdf, docx, pptx, xlsx, csv. Open WebUI mặc định trích chữ bằng pypdf và có thể chuyển sang Tika hoặc Docling để đọc PDF scan, ảnh chứa chữ. Với bảng số liệu cần tính toán, nên lưu thành CSV trước khi tải lên.
Hỏi đáp tài liệu nội bộ bằng AI Local có cần Internet không?
Chỉ cần mạng khi tải phần mềm, tải model và cập nhật. Theo tài liệu LM Studio, việc chat và xử lý tài liệu diễn ra hoàn toàn trên máy. Lưu ý nếu bạn nối thêm API đám mây hoặc dùng model có hậu tố cloud thì dữ liệu sẽ rời máy.
AI Local có làm được file PowerPoint không?
Có ba hướng. Marp biến Markdown do model viết thành slide và xuất PPTX, PDF, nhưng PPTX mặc định không sửa được chữ. Presenton tạo slide bằng AI, nối được Ollama, xuất PPTX và PDF. Agent Document Generation của AnythingLLM tạo được PowerPoint; tài liệu của họ khuyến nghị model từ 8B trở lên cho việc này.
Vì sao AI Local trả lời như không đọc tài liệu tôi đã tải lên?
Một nguyên nhân hay gặp: Ollama mặc định độ dài ngữ cảnh 4096 token trên máy có VRAM dưới 24GB, nên phần tài liệu truy xuất có thể không được dùng tới. Tài liệu Open WebUI khuyên tăng lên 8192 trở lên. Ngoài ra hãy kiểm tra tệp có phải PDF scan cần OCR không.
Nhân viên có thể dùng chung một hệ thống hỏi đáp nội bộ không?
Được. Open WebUI là giao diện tự host cho nhiều người, có kho kiến thức gắn vào model. AnythingLLM bản Docker hỗ trợ nhiều người dùng, còn bản Desktop dành cho một người. Máy chạy model nên đặt trong mạng nội bộ, không mở cổng ra Internet.
Tài liệu liên quan
- AI Local · AI AgentAI Local là gì? Chạy AI ngay trên máy tính, không tốn phí APIAI Local là gì: chạy model AI mở ngay trên máy tính của bạn, không trả phí API theo lượt, dữ liệu ở lại máy. Lợi ích, giới hạn, so sánh với AI đám mây.
- AI Local · AI AgentCấu hình máy tính chạy AI Local: RAM, VRAM, Mac hay PC NVIDIACấu hình máy tính chạy AI Local: RAM, VRAM quyết định model nào chạy được, cách ước tính dung lượng theo Q4/Q8, Mac hay PC NVIDIA, ổ cứng, mua máy hay thuê GPU.
- AI Local · AI AgentBản đồ model AI mở 2026: chọn model theo việc và theo máyBản đồ model AI mở 2026: Qwen, Gemma 4, gpt-oss, Llama 4, Mistral, GLM, DeepSeek, Phi; cỡ, MoE hay dense, giấy phép thương mại, tag Ollama, tự thử tiếng Việt.
- AI Local · AI AgentCài AI Local trong 30 phút: Ollama, LM Studio và Open WebUICài AI Local từng bước trên Windows, macOS, Linux: chọn Ollama, LM Studio, Jan hay llama.cpp, chạy thử model nhỏ, đặt context, dựng Open WebUI cho nhóm.
Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local
Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.
Nguồn tham khảo
- Open WebUI Docs – Knowledge
- Open WebUI Docs – RAG
- Open WebUI Docs – Document extraction
- Open WebUI Docs – Python code execution
- GitHub – AnythingLLM
- AnythingLLM Docs – Document Generation agent
- LM Studio Docs – Chat with documents
- GitHub – Marp CLI
- GitHub – Presenton
Lịch sử cập nhật
- 07/10/2026 — Bản đầu.
Miễn trừ trách nhiệm
Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.