OpenCreator: Xưởng AI Nguồn Mở Tự Động Phụ Đề, Lồng Tiếng Và Cắt Shorts
Mổ xẻ OpenCreator (tiền thân KrillinAI), cỗ máy Go và Electron nguồn mở giúp tự động bóc phụ đề, dịch thuật, lồng tiếng và cắt video dọc đa nền tảng.

Làm xong một video kỹ thuật dài 10 phút đã mệt phờ râu. Nhưng công đoạn sau đó mới thực sự là cực hình: ngồi cắt nhỏ từng đoạn, bóc băng phụ đề, dịch sang 3 thứ tiếng, căn giọng đọc lồng tiếng không lệch nhịp, rồi xoay dọc khung hình đăng lên TikTok, YouTube Shorts và Reels.
Trước giờ anh em lập trình viên chỉ có hai lựa chọn: hoặc chắp vá năm bảy công cụ rời rạc bằng script dòng lệnh loằng ngoằng, hoặc nạp tiền cho các dịch vụ SaaS đám mây đóng khung với đủ thứ giới hạn thời lượng và hình mờ khó chịu.
OpenCreator (tiền thân là KrillinAI) xuất hiện để giải quyết nút thắt này. Với hơn 12.000 ngôi sao trên GitHub, công cụ nguồn mở này gom trọn nhân thực thi viết bằng Go siêu nhẹ, mô hình Whisper chạy cục bộ, giọng đọc AI và công cụ FFmpeg vào một xưởng làm việc duy nhất trên máy tính.
Tóm tắt (TL;DR)
Hộp Trả Lời Nhanh (Google Search Featured Snippet):
- OpenCreator là gì? OpenCreator (tên cũ KrillinAI) là không gian làm việc sáng tạo đa phương thức nguồn mở, kết hợp nhân Go CLI, tác tử Codex và giao diện Electron. Hệ thống tự động hóa hoàn toàn việc trích xuất video, bóc phụ đề (Whisper), dịch ngữ cảnh (LLM), lồng tiếng (TTS) và dựng video dọc 9:16 ngay trên máy cá nhân.
- Điểm cốt lõi 1: Gom yt-dlp, Whisper, LLM, Edge TTS và FFmpeg vào một cỗ máy trạng thái khép kín duy nhất.
- Điểm cốt lõi 2: Vận hành cục bộ 100%, bảo đảm file video gốc và mã API không bao giờ rò rỉ lên đám mây bên thứ ba.
- Mã nguồn: krillinai/OpenCreator (Apache-2.0, 12.1k stars)
Bản đồ tư duy (Beginner Map)
Hãy hình dung OpenCreator như một dây chuyền lắp ráp ô tô tự động trong nhà máy cơ khí. Bạn đẩy một khung xe thô (video gốc quay ngang) vào băng chuyền tiếp nhận. Hệ thống tự động tháo máy kiểm tra (tách luồng âm thanh bằng yt-dlp), dùng cảm biến siêu âm làm sạch từng chi tiết (bóc băng chữ bằng Whisper), lắp cụm vô-lăng phù hợp thị trường quốc tế (dịch thuật ngữ cảnh và cắt phụ đề chuẩn nhịp bằng LLM), cân chỉnh âm thanh ống xả (lồng tiếng bằng giọng đọc AI) và dùng tia laser gọt khung xe thành một chiếc xe nhỏ gọn đi phố (cắt dựng khung dọc 9:16 bằng FFmpeg), tất cả điều phối qua một phiếu theo dõi duy nhất.
Phần 1: Nền tảng (Foundations)
Trước khi có OpenCreator, việc tái sử dụng video là chuỗi thao tác rời rạc:
- Tách âm thanh từ video bằng NLE (phần mềm dựng phim chuyên nghiệp / non-linear video editor).
- Nạp âm thanh vào công cụ STT (chuyển đổi giọng nói thành văn bản / speech-to-text) lấy mốc thời gian.
- Xuất tệp SRT (định dạng phụ đề có gắn mốc thời gian / subtitle file format), sửa thủ công các đoạn ngắt câu ngập ngừng.
- Nạp văn bản vào mô hình dịch thuật rồi đưa sang TTS (tổng hợp giọng nói nhân tạo / text-to-speech) lấy file đọc lồng tiếng.
- Thu phóng khung hình 16:9 về dọc 9:16, gắn phụ đề, dìm nhạc nền và xuất video.
Chỉ cần video gốc đổi vài giây, toàn bộ chuỗi mắt xích thủ công sẽ vỡ vụn. Mọi mốc thời gian xô lệch và bạn phải làm lại từ đầu.
OpenCreator xử lý sự mong manh này bằng cỗ máy trạng thái xoay quanh tệp nhật ký cục bộ (krillinai_manifest.json). Quy trình xử lý video được chuẩn hóa thành chuỗi các hàm thuần túy có thể tái tạo bất kỳ lúc nào:
- Tiếp nhận âm thanh: Trích xuất luồng tiếng 16kHz chuẩn qua yt-dlp.
- Căn chỉnh khẩu độ từ: Nhận dạng giọng nói bằng Whisper hoặc faster-whisper tạo ma trận thời gian chính xác.
- Dịch thuật ngữ cảnh: Dùng LLM (mô hình ngôn ngữ lớn / large language model) dịch theo mạch tự nhiên thay vì ghép từ cơ học.
- Lồng tiếng tự nhiên: Tạo giọng đọc qua Edge TTS (tổng hợp giọng đọc nhẹ không phí), OpenAI TTS hoặc MiniMax.
- Dựng khung hình: Gọi FFmpeg (công cụ xử lý video dòng lệnh / multimedia CLI engine) xếp lớp hình ảnh, in phụ đề, dìm nhạc nền và đóng khung dọc cho di động.
Phần 2: Khảo sát (Investigation)
OpenCreator phân tách kiến trúc rõ ràng: nhân điều phối viết bằng Go (runtime/krillinai) kết hợp giao diện Electron tiện dụng.
1. Nhân Dòng Lệnh Bằng Go
Tránh các lỗi xung đột môi trường thường thấy ở Python, OpenCreator xây dựng nhân thực thi chính bằng tệp nhị phân Go (krillinai-cli). Tệp nhị phân này quản lý tiến trình ngoại vi, điều phối dịch thuật song song, đo đạc độ rộng ký tự và xuất tiến độ JSON chuẩn.
Các thao tác chính có thể kích hoạt trực tiếp từ terminal:
# 1. Trích xuất phụ đề song ngữ từ video
krillinai-cli subtitle "https://www.youtube.com/watch?v=example" \
--origin-lang en \
--target-lang vi \
--workdir /tmp/job_01 \
--caption-source any \
--prepare-video
# 2. Tạo bản đọc lồng tiếng bằng giọng AI
krillinai-cli tts \
--workdir /tmp/job_01 \
--engine edge-tts \
--voice vi-VN-NamMinhNeural
# 3. Dựng video dọc 9:16 có phụ đề đôi và lồng tiếng hoàn chỉnh
krillinai-cli render-vertical \
--workdir /tmp/job_01 \
--video /tmp/job_01/origin_video.mp4 \
--subtitle /tmp/job_01/short_origin_mixed_srt.srt \
--dubbed \
--major-title "Kiến Trúc Hệ Thống" \
--minor-title "Tự Động Hóa AI"
2. Thuật Toán Đo Độ Rộng Ký Tự Phụ Đề Dọc
Khi dựng video dọc cho điện thoại, phụ đề dài rất dễ tràn lề hoặc che mặt nhân vật. Nhân Go của OpenCreator tích hợp thuật toán tính độ rộng hiển thị:
- Ký tự CJK và chữ toàn giác tính bằng 2 đơn vị độ rộng.
- Chữ cái Latin, số và dấu câu tính bằng 1 đơn vị độ rộng.
- Thay vì dồn ba tầng chữ (
\N) làm tối khung hình, hệ thống phân tách câu dài theo trục thời gian thành các mẩu đối thoại ngắn kế tiếp nhau.
Phụ đề hiển thị trên màn hình dọc luôn gọn gàng mà không cần căn chỉnh tay từng keyframe.
3. Khôi Phục Quy Trình Qua Manifest
Tiến trình xử lý được lưu vào krillinai_manifest.json:
{
"version": "1.0",
"task_id": "task_20260922_video01",
"stages": {
"subtitle": {
"status": "completed",
"origin_srt": "/tmp/job_01/origin_language_srt.srt",
"target_srt": "/tmp/job_01/target_language_srt.srt",
"mixed_srt": "/tmp/job_01/short_origin_mixed_srt.srt"
},
"tts": {
"status": "completed",
"audio_track": "/tmp/job_01/dubbed_audio.mp3"
},
"render_vertical": {
"status": "ready",
"source_video": "/tmp/job_01/origin_video.mp4"
}
}
}
Nếu máy tính hết đĩa ở công đoạn dựng hình cuối, bạn không phải tốn token gọi lại API dịch hay bóc băng. Hệ thống đọc manifest và chạy tiếp bước dang dở.
Phần 3: Chẩn đoán (The Rough Edges)
Vận hành OpenCreator thực tế cần lưu ý bốn góc khuất kỹ thuật sau:
1. Tràn VRAM Khi Chạy Whisper Cục Bộ
Mô hình Whisper large-v3 bóc băng rất chuẩn nhưng đòi hỏi 6GB đến 10GB VRAM (bộ nhớ tạm card đồ họa / video random-access memory). Máy tính dùng card đồ họa tích hợp chạy mô hình này cùng Electron dễ bị hệ thống tự tắt đột ngột (OOM kill).
Giải pháp: Cấu hình sang faster-whisper lượng tử hóa int8 để giữ mức chiếm dụng dưới 2GB, hoặc trỏ sang API đám mây tốc độ cao như Groq hay OpenAI Whisper.
2. Giới Hạn Tần Suất Của Edge TTS
Microsoft Edge TTS tạo giọng đọc tự nhiên miễn phí nhưng kết nối qua endpoint công cộng. Bắn 50 đoạn thoại song song dồn dập sẽ bị máy chủ ngắt socket hoặc trả lỗi 429. Hãy giới hạn worker song song ở mức 3 đến 4 luồng để giữ kết nối ổn định.
3. Điểm Mù Khi Cắt Khung Hình Ngang Thành Dọc
Cắt video ngang 16:9 sang dọc 9:16 bằng cơ chế căn giữa mặc định sẽ làm mất hình nếu người nói bước sang góc màn hình. Hãy chọn bố cục làm mờ nền trên dưới: giữ video 16:9 ở giữa và dùng chính video đó phóng to mờ lấp đầy khoảng trống, bảo đảm an toàn cho các video quay màn hình code.
4. Lệch Nhịp Thời Gian Giữa Các Ngôn Ngữ
Câu tiếng Việt hoặc tiếng Đức thường dài hơn tiếng Anh từ 20% đến 35%. Nếu phân cảnh gốc dài 3 giây mà file đọc tiếng Việt cần 4,2 giây, âm thanh sẽ đè lên cảnh sau. Dù FFmpeg có bộ lọc atempo nén thời gian, tăng tốc quá 1.25x sẽ làm giọng the thé như sóc chuột. Hãy thêm yêu cầu trong prompt dịch thuật để số lượng âm tiết tương đương ngôn ngữ gốc.
Phần 4: Giải pháp (Resolution)
Bảng so sánh lựa chọn công cụ:
| Tiêu chí | OpenCreator | Dịch vụ SaaS (Opus/CapCut) | Script Bash/Python tự viết |
|---|---|---|---|
| Chi phí | Miễn phí (Mã nguồn mở Apache-2.0) | $15–$50 / tháng | Miễn phí |
| Bảo mật dữ liệu | Cục bộ 100% trên máy | Đẩy video lên đám mây ngoài | Cục bộ 100% |
| Độ bền quy trình | Phục hồi qua file manifest | Hộp đen dịch vụ đám mây | Dễ hỏng khi môi trường đổi |
| Phụ đề song ngữ | Tự tính độ rộng ký tự CJK | Đa phần chỉ hỗ trợ đơn ngữ | Phải tự tính toán thủ công |
| Khả năng mở rộng | Hỗ trợ hệ thống Codex SKILL.md | Đóng kín hoàn toàn | Tự do chỉnh sửa |
| Bảo trì | Một binary duy nhất + giao diện | Không cần bảo trì | Chi phí bảo trì mã nguồn lớn |
Chọn OpenCreator Khi:
- Cần dịch thuật video hoặc cắt video ngắn định kỳ mà không muốn chịu phí dịch vụ đám mây đắt đỏ.
- Xử lý video nội bộ công ty hoặc mã nguồn mật cần bảo mật dữ liệu tuyệt đối trên máy.
- Cần cả giao diện kéo thả trực quan lẫn khả năng chạy dòng lệnh tự động hóa.
Bỏ Qua OpenCreator Khi:
- Cần dựng phim điện ảnh nhiều lớp, chỉnh màu chuyên sâu và lọc âm phức tạp (hãy dùng DaVinci Resolve hoặc Premiere).
- Máy tính có dưới 8GB RAM và không có Internet để gọi API hỗ trợ từ xa.
Lời khuyên cuối (Final Take)
Tự động hóa video không còn là việc viết script chắp vá hay giao dữ liệu cho các nền tảng tính phí. Bằng việc kết hợp Whisper, giọng đọc AI và FFmpeg sau bộ điều phối Go gọn nhẹ, OpenCreator biến quy trình sản xuất video đa nền tảng thành một bước build mã nguồn chính xác và đáng tin cậy.
Thử thách thực hành (Student First Assignment)
Dành 20 phút thử nghiệm trực tiếp trên máy của bạn:
- Kéo mã nguồn OpenCreator về máy:
git clone https://github.com/krillinai/OpenCreator.git cd OpenCreator pnpm install - Biên dịch nhân Go:
pnpm krillinai:build - Chạy thử nghiệm bóc phụ đề trên một video YouTube ngắn với cờ
--dry-runđể kiểm tra yt-dlp, FFmpeg và cấu hình mô hình trên máy. - Mở tệp
krillinai_manifest.jsontrong thư mục làm việc để quan sát cách các trạng thái dữ liệu được ghi nhận.
Câu hỏi thường gặp (FAQ)
OpenCreator có bắt buộc card đồ họa rời để chạy không?
Không bắt buộc. Bạn có thể chạy Whisper trên CPU qua whisper.cpp hoặc faster-whisper. Ngoài ra, bạn có thể đẩy bước nhận dạng và dịch sang API đám mây (OpenAI, Groq, DeepSeek) trong khi việc dựng hình vẫn do CPU đảm nhiệm.
Làm sao để dùng OpenCreator hoàn toàn miễn phí?
Hệ thống chạy trên phần cứng của bạn bằng công cụ nguồn mở (yt-dlp, FFmpeg, Whisper) kết hợp Microsoft Edge TTS không tốn phí bản quyền. Bạn chỉ trả tiền nếu chủ động dùng các khóa API trả phí ngoài.
OpenCreator có tạo video từ đầu được không hay chỉ dịch video có sẵn?
Hỗ trợ cả hai. Ngoài việc dịch, lồng tiếng và cắt khung hình dọc, không gian làm việc còn có công cụ tạo hoạt hình người que, viết bài, lập kịch bản và kết nối mô hình tạo ảnh, video AI.
Điểm khác biệt giữa OpenCreator và script FFmpeg tự viết là gì?
Script tự viết thiếu cơ chế khôi phục trạng thái và không biết ngắt dòng theo độ rộng ký tự. OpenCreator quản lý quy trình bằng manifest thông minh tránh tính toán trùng lặp, tách dòng chuẩn xác cho tiếng Việt và cung cấp giao diện trực quan bên cạnh CLI.
Bài viết liên quan
- AI & Agents
VoiceStudio Explained: Động Cơ Lồng Tiếng AI Và Nhân Bản Giọng Nói 33k Sao
Khám phá VoiceStudio, giải pháp thay thế ElevenLabs mã nguồn mở 33k sao hỗ trợ 646 ngôn ngữ, nhân bản giọng OmniVoice và giao thức MCP cho AI agent.
14 phút đọcĐọc tiếp → - AI & Agents
Pixelle-Video: Một dòng chủ đề, một dây chuyền ComfyUI
Streamlit cục bộ: chủ đề hoặc script thành video ngắn qua LLM, ComfyUI/RunningHub, TTS, nhạc nền, template HTML; file ra trong output/.
7 phút đọcĐọc tiếp → - AI & Agents
Voice-Pro Explained: Studio Lồng Tiếng AI Và Nhân Bản Giọng Nói
Khám phá Voice-Pro, studio lồng tiếng AI cục bộ mã nguồn mở kết hợp Whisper, Demucs, F5-TTS và CosyVoice bằng uv để nhân bản giọng nói không tốn phí.
13 phút đọcĐọc tiếp → - AI & Agents
OpenHuman Explained: Cỗ Máy AI Cá Nhân Hóa 40k Sao Với Trí Nhớ Obsidian
Khám phá OpenHuman, cỗ máy AI cá nhân hóa 40k sao mã nguồn mở với bộ nhớ Obsidian, nén ngữ cảnh TokenJuice và điều phối agent đa tầng.
19 phút đọcĐọc tiếp →