Hiểu và dùng AI Local · Bài 7

AI Local cho video và giọng nói: phụ đề, đọc giọng, video ngắn

Chép lời, làm phụ đề, đọc giọng và tạo đoạn video ngắn ngay trên máy của mình. Bài viết chỉ ra việc nào máy phổ thông làm tốt, việc nào cần GPU lớn, giọng đọc tiếng Việt nào dùng thương mại được, tổng hợp từ tài liệu chính thức tại ngày 07/10/2026.

Cập nhật 07/10/2026⏱ 7 phút đọcKiến thức nềnNgười mới → Trung cấp

Mỗi video mất cả buổi chỉ để gõ phụ đề

Chủ một shop mỹ phẩm quay ba video ngắn mỗi tuần. Phần quay chỉ mất một giờ, nhưng gõ phụ đề, thu lại giọng giới thiệu sản phẩm và tìm cảnh phụ mất cả buổi. Các bản ghi âm buổi tư vấn khách cũng cần chép lời, nhưng chị ngại tải lên dịch vụ bên ngoài. (Tình huống minh hoạ.)

AI Local giúp được phần lặp lại: chép lời, làm phụ đề, đọc giọng, tạo cảnh phụ ngắn, ngay trên máy của bạn. Nhưng ba việc này có độ sẵn sàng rất khác nhau.

Ba việc, ba mức máy khác nhau

AI Local cho video và giọng nói là dùng model mở chạy trên máy của bạn để chép lời thành văn bản, làm phụ đề, đọc văn bản thành giọng nói và tạo đoạn video ngắn, thay vì gửi tệp lên dịch vụ đám mây.

Ba việc AI Local cho video và giọng nói theo mức máy tăng dần: chép lời, phụ đề nhẹ nhất với Whisper, whisper.cpp giấy phép MIT, từ khoảng 1GB đến 10GB VRAM, chạy được bằng CPU, xuất SRT, VTT; đọc giọng tiếng Việt mức vừa với VieNeu-TTS v3 Apache-2.0 khoảng 1GB VRAM hoặc CPU, Piper vais1000 chưa rõ được dùng thương mại hay không; tạo video ngắn nặng nhất với Wan 2.1 1.3B khoảng 8,19GB VRAM, HunyuanVideo 1.5 14GB khi offload, model lớn 45 đến 80GB
Hình: Phụ đề nhẹ nhất, giọng đọc ở giữa, video nặng nhất (minh hoạ)

Nền tảng chung về máy, phần mềm, model xem ở AI Local là gì và Cấu hình máy tính chạy AI Local.

Chép lời và làm phụ đề bằng Whisper

Whisper của OpenAI dùng giấy phép MIT cho cả mã và trọng số, có tiếng Việt (mã vi), xuất phụ đề dạng txt, vtt, srt, tsv, json. Bảng chính thức:

BảnTham sốVRAM cầnTốc độ tương đối
tiny39M~1GB~10x
base74M~1GB~7x
small244M~2GB~4x
medium769M~5GB~2x
large1550M~10GB1x
turbo809M~6GB~8x

Tốc độ đo khi chép tiếng Anh trên GPU A100; README lưu ý tốc độ thực tế có thể khác nhiều. Bản turbo không được huấn luyện cho việc dịch.

Lệnh trên máy tính của bạnChạy trong Terminal trên máy của bạn; đổi tên tệp cho đúng
# Whisper bản gốc: cần Python và FFmpeg
pip install -U openai-whisper
whisper bai-noi.mp3 --model turbo --language vi --output_format srt
Lệnh trên máy tính của bạnwhisper-cli hiện chỉ đọc WAV 16-bit nên cần đổi định dạng bằng FFmpeg trước
# whisper.cpp: sau khi build theo README
sh ./models/download-ggml-model.sh medium
ffmpeg -i bai-noi.mp3 -ar 16000 -ac 1 -c:a pcm_s16le bai-noi.wav
./build/bin/whisper-cli -m models/ggml-medium.bin -f bai-noi.wav -l vi -osrt

Phụ đề tạo ra là bản nháp: đọc lại tên riêng, tên sản phẩm, giá và số điện thoại trước khi đăng. Bản ghi âm buổi tư vấn khách là dữ liệu cá nhân; chép lời trên máy giúp tệp không rời máy, nhưng vẫn phải lưu trữ, xoá theo quy định bảo vệ dữ liệu cá nhân.

Nguồn: OpenAI Whisper · whisper.cpp · whisper-cli · faster-whisper · PhoWhisper-large

Đọc giọng tiếng Việt: chọn đúng giấy phép

Đọc văn bản thành giọng nói (TTS) là phần dễ vướng giấy phép nhất. Kiểm tra ngày 07/10/2026:

Dự ánGiấy phépThương mại?Ghi chú
VieNeu-TTS v3 TurboApache-2.0 (mã và trọng số)Có25 giọng Bắc, Trung, Nam; GPU RTX 3060 dùng 0,9–1,1GB VRAM; chạy được bằng CPU. Bản v4 đóng mã, chỉ có qua API
Piper, giọng vi_VN vais1000Dữ liệu vais1000 CC BY 4.0; engine hiện là GPL-3.0Chưa rõTinh chỉnh từ giọng tiếng Anh lessac, dữ liệu gốc chỉ cho nghiên cứu. Giọng vivos là CC BY-NC-SA (không thương mại)
viXTTSCoqui Public Model LicenseKhông, kể cả âm thanh tạo ra
F5-TTS gốc và bản tiếng Việt ViVoiceMã MIT; trọng số CC-BY-NC hoặc CC-BY-NC-SA-4.0KhôngCấm nhân bản giọng khi không có sự đồng ý hợp pháp
MMS-TTS vie (Meta)CC-BY-NC 4.0Không
Kokoro-82M, VibeVoiceApache-2.0, MITKhông có tiếng Việt; mã TTS của VibeVoice đã bị gỡ ngày 05/09/2025

Với VieNeu-TTS, nhà phát triển ghi chạy trên CPU (ONNX) đạt RTF khoảng 0,5 trên Core i5 thế hệ 12, nghĩa là tạo 10 giây giọng mất khoảng 5 giây (cách hiểu chỉ số RTF). Dự án có nhân bản giọng từ đoạn ghi âm 3–8 giây.

Chỉ nhân bản giọng của chính bạn hoặc của người đã đồng ý bằng văn bản. Không nhái giọng người nổi tiếng, khách hàng, đồng nghiệp, đối thủ. Nội dung giả lập người thật phải gắn nhãn theo Luật Trí tuệ nhân tạo.

Chất lượng đọc tiếng Việt chưa có xếp hạng chính thức. Hãy lấy 5 đoạn kịch bản thật (có tên sản phẩm, giá, tiếng địa phương), tạo bằng vài giọng có sẵn của dự án dùng thương mại được, so với giọng tự đọc, nhờ vài người nghe chấm rồi mới chọn.

Nguồn: VieNeu-TTS · VieNeu-TTS v3 Turbo · Piper vais1000 · Piper lessac · Giấy phép dữ liệu Lessac · viXTTS · F5-TTS Vietnamese · MMS-TTS vie · Kokoro voices · VibeVoice

Model video mở và máy cần có

ModelGiấy phép · thương mạiMáy theo nguồn chính thức
Wan 2.1 T2V-1.3BApache-2.0 · CóKhoảng 8,19GB VRAM; video 5 giây 480P mất khoảng 4 phút trên RTX 4090
Wan 2.2 TI2V-5BApache-2.0 · Có720P 24fps; GPU từ 24GB (ví dụ RTX 4090) khi bật offload; video 5 giây dưới 9 phút trên một GPU phổ thông
Wan 2.2 A14BApache-2.0 · CóMột GPU cần từ 80GB VRAM
LTX-2, LTX-2.5LTX-2.x Community License · Có điều kiệnTạo cả video lẫn âm thanh; doanh thu năm từ 10 triệu USD phải mua giấy phép; không công bố VRAM
HunyuanVideo 1.5 (8,3B)Tencent Hunyuan Community License · Có điều kiệnTối thiểu 14GB khi bật offload; không áp dụng tại EU, Anh, Hàn Quốc
HunyuanVideo (13B+)Như trên45–60GB tuỳ độ phân giải, khuyến nghị 80GB

Giới hạn thực tế: mỗi lần chỉ được clip vài giây, chờ tính bằng phút, kết quả cần chọn lọc. Model lớn cần GPU 45–80GB, nghĩa là thuê GPU theo giờ hoặc dùng dịch vụ đám mây. Với video bán hàng, cảnh quay thật vẫn là phần chính; AI hợp làm cảnh phụ, chuyển cảnh, minh hoạ ý tưởng.

Nguồn: Wan 2.1 · Wan 2.2 · Wan-AI · LTX-Video · LTX-2 License · HunyuanVideo · HunyuanVideo 1.5 · ComfyUI · Draw Things

Quy trình làm video ngắn có AI Local hỗ trợ

Ví dụ minh hoạ cho một video giới thiệu sản phẩm dài 30–60 giây:

Sáu trạm làm video ngắn có AI Local hỗ trợ: kịch bản viết bằng model chữ local, giọng thật hoặc TTS dùng thương mại được, hình quay thật cộng cảnh AI, phụ đề Whisper xuất SRT, người kiểm duyệt cuối, gắn nhãn AI rồi mới đăng; khung không làm: không nhái giọng người khác khi chưa đồng ý, không giả mạo người thật, không xoá nhãn AI, không dùng giọng phi thương mại để bán hàng
Hình: Sáu bước làm video ngắn, AI làm nháp, con người duyệt (minh hoạ)
  1. Kịch bảnModel chữ local viết nháp, người sửa; xem AI Local viết content
  2. GiọngTự đọc, hoặc TTS dùng thương mại được như VieNeu-TTS v3 (Apache-2.0)
  3. HìnhQuay thật là chính; cảnh phụ từ ảnh AI (tạo ảnh bằng AI Local) hoặc clip ngắn
  4. Phụ đềWhisper xuất SRT, người đọc lại rồi đưa vào phần mềm dựng
  5. DuyệtNgười phụ trách xem toàn bộ: nội dung, giọng, giấy phép
  6. Nhãn AI, đăngKhai báo nội dung AI theo nền tảng, lưu hồ sơ công cụ đã dùng
Quy trình video ngắn có người duyệt (ví dụ minh hoạ).

Nhãn AI, giả mạo và những điều không làm

Luật Trí tuệ nhân tạo (Luật 134/2025/QH15) có hiệu lực từ 01/03/2026. Theo Báo Đại biểu Nhân dân, Điều 11 yêu cầu đánh dấu âm thanh, hình ảnh, video do AI tạo theo định dạng máy đọc được, thông báo rõ khi nội dung AI có thể gây nhầm lẫn về sự kiện hoặc nhân vật thật, và gắn nhãn nội dung giả lập ngoại hình, giọng nói người thật; Chính phủ quy định chi tiết. Luật cũng cấm tẩy xoá, làm sai lệch nhãn bắt buộc. Chi tiết hơn ở bài tạo ảnh.

Không làm video giả mạo người thật, không nhái giọng người khác khi chưa được đồng ý, không dùng giọng phi thương mại cho video bán hàng, không xoá nhãn AI mà nền tảng yêu cầu.

Nguồn: Báo Đại biểu Nhân dân – Điều 11 · Cổng Xây dựng chính sách – Luật Trí tuệ nhân tạo · Meta · TikTok · YouTube

Bắt đầu từ đâu?

  1. Phụ đề trước: cài Whisper hoặc whisper.cpp, chép lời 3 video cũ, so với phụ đề bạn đã gõ tay.
  2. Thử giọng đọc: chạy VieNeu-TTS v3 với 5 đoạn kịch bản thật; nếu chưa ưng thì tiếp tục tự đọc.
  3. Video AI để sau: thử Wan 2.1 1.3B khi card có VRAM vượt mức khoảng 8,19GB mà model cần, hoặc thuê GPU theo giờ.

Đọc tiếp: Bản đồ model AI mở 2026, 40 việc AI Local làm được, Chi phí thật và bảo mật khi dùng AI Local.

Muốn được tư vấn hoặc cài đặt AI Local theo nhu cầu riêng, bạn có thể đăng ký Tư vấn 1-1 hoặc Coaching 1-1 cho doanh nghiệp; chi phí báo sau buổi tư vấn.

Đọc tiếp: Chatbot trả lời tin nhắn →

Câu hỏi thường gặp

Whisper có chép lời tiếng Việt được không?

Có. Whisper của OpenAI có tiếng Việt (mã vi), giấy phép MIT cho cả mã và trọng số, xuất phụ đề SRT, VTT. VinAI có PhoWhisper, bản Whisper tinh chỉnh trên 844 giờ tiếng Việt, giấy phép BSD-3-Clause. Độ chính xác tuỳ chất lượng ghi âm, nên luôn đọc lại tên riêng, giá, số điện thoại trước khi đăng.

Giọng đọc tiếng Việt chạy local nào dùng thương mại được?

Theo kiểm tra 10/2026, VieNeu-TTS v3 Turbo dùng Apache-2.0 cho cả mã và trọng số. viXTTS, F5-TTS bản tiếng Việt và MMS-TTS tiếng Việt chỉ cho dùng phi thương mại. Giọng Piper vais1000 có dữ liệu CC BY 4.0 nhưng được tinh chỉnh từ một giọng tiếng Anh mà dữ liệu gốc cấm dùng thương mại, nên cần hỏi ý kiến pháp lý trước. Giấy phép có thể đổi, hãy đọc lại trang gốc trước khi dùng.

Có được nhân bản giọng của người khác không?

Chỉ dùng giọng của chính bạn hoặc của người đã đồng ý bằng văn bản. Model card F5-TTS tiếng Việt cấm nhân bản giọng khi không có sự đồng ý hợp pháp, và Luật Trí tuệ nhân tạo của Việt Nam yêu cầu gắn nhãn nội dung giả lập người thật.

Máy tính bình thường có tạo video bằng AI được không?

Model nhỏ thì có thể: Wan 2.1 bản 1.3B cần khoảng 8,19GB VRAM và mất khoảng 4 phút cho video 5 giây 480P trên RTX 4090; HunyuanVideo 1.5 cần tối thiểu 14GB khi bật offload. Model lớn như Wan 2.2 A14B cần từ 80GB VRAM, phải thuê GPU hoặc dùng dịch vụ đám mây.

Video làm bằng AI đăng lên mạng có phải ghi nhãn không?

Với video, âm thanh trông hoặc nghe như thật thì nên ghi. Meta bắt buộc tự khai với video chân thực và âm thanh nghe như thật; TikTok và YouTube cũng yêu cầu khai báo nội dung AI chân thực. Luật Trí tuệ nhân tạo của Việt Nam có hiệu lực từ 01/03/2026 yêu cầu minh bạch với nội dung AI dễ gây nhầm lẫn.

Tài liệu liên quan

Xem tất cả tài liệu hướng dẫn →

Đăng ký Tư vấn 1-1 về AI Local – Nguyễn Đức, Aduca
Bước tiếp theo

Đăng ký Tư vấn 1-1 về AI Local

Chuyên gia Aduca cùng bạn xem nhu cầu, máy đang có và dữ liệu cần bảo vệ, rồi đề xuất nên chạy AI Local, dùng đám mây hay kết hợp. Dịch vụ cài AI Local nằm trong gói Tư vấn 1-1 hoặc Coaching 1-1; chi phí báo sau buổi tư vấn.

Về AducaChuỗi bài do đội ngũ Aduca biên soạn từ kinh nghiệm đào tạo và triển khai AI Agent cho Marketing – Sales. Aduca Academy do Nguyễn Đức – Chủ tịch Aduca Group sáng lập; ông kinh doanh thương mại điện tử từ 2012, chạy quảng cáo Facebook từ 2014 và đào tạo từ 2016. Phần thực hành từng bước nằm trong các thư mục OpenClaw, Hermes Agent, Claude, ChatGPT và n8n.

Nguồn tham khảo

Lịch sử cập nhật

Miễn trừ trách nhiệm

Bài viết thuộc chuỗi kiến thức của Công ty Cổ phần Giáo dục Aduca, chia sẻ miễn phí cho mục đích học tập. Thông tin kỹ thuật đối chiếu với tài liệu chính thức của các dự án và nền tảng tại ngày cập nhật (có ghi nguồn); phần nhận định là quan điểm của Aduca. OpenClaw, Hermes Agent, Claude (thương hiệu của Anthropic), ChatGPT (thương hiệu của OpenAI), n8n (thương hiệu của n8n GmbH), các phần mềm chạy model và các model AI mở (Ollama, LM Studio, Qwen, Gemma, gpt-oss…) cùng các phần mềm, dịch vụ nêu trong bài thuộc về chủ sở hữu tương ứng, không thuộc Aduca; Aduca không phải đối tác chính thức của các công ty này. Tính năng, gói và giá có thể thay đổi bất cứ lúc nào – hãy kiểm tra trang chính thức trước khi mua. Kết quả áp dụng phụ thuộc quy trình, dữ liệu và con người của từng doanh nghiệp; bài viết không cam kết doanh thu hay hiệu quả cụ thể. © 2026 Aduca — được trích dẫn khi ghi rõ nguồn aduca.vn.