Voice Studio từ A đến Z
Toàn bộ ảnh trong trang này chụp trực tiếp từ ứng dụng đang chạy. Voice Studio làm việc hoàn toàn offline — model chạy trên máy bạn, không gửi âm thanh đi đâu cả.
Voice Studio là gì
Một ứng dụng desktop chạy model giọng nói ngay trên máy bạn. Không cần internet để tạo tiếng, không có phí theo ký tự, và âm thanh không rời khỏi máy.
Tạo giọng
Sao chép giọng từ mẫu ngắn, hoặc tạo giọng mới bằng thuộc tính.
Nhiều nhân vật
Kịch bản hội thoại, mỗi nhân vật một giọng riêng.
Phụ đề
Bóc lời từ audio/video, rồi dịch phụ đề bằng LLM.
Cài đặt & nạp model
Lần chạy đầu tiên cần tải model về máy. Vào Quản lý Model ở thanh bên, tải gói giọng đọc (TTS) — bắt buộc — và ít nhất một model nhận dạng nếu bạn định tách phụ đề.
Sao chép giọng
Nhân bản một giọng từ 5–10 giây âm thanh mẫu. Đây là màn hình mặc định khi mở app.
- Tệp âm thanh mẫu — kéo thả hoặc chọn file. Mẫu càng sạch (không nhạc nền, không nhiều người nói) thì giọng clone càng giống.
- Văn bản mẫu (bắt buộc) — gõ lại chính xác lời nói trong mẫu. Sai một chữ cũng làm giọng lệch. Không muốn gõ tay thì bấm AI gợi ý để Whisper tự điền.
- Nội dung văn bản — nhập câu cần đọc bằng giọng vừa clone, mỗi dòng một câu.
Cài đặt nâng cao
Độ chi tiết (số bước sinh), Mức độ bám sát (bám mẫu chặt hay thoáng) và Tốc độ đọc. Mỗi ô có nút ↺ để trả về mặc định — cứ thử, không sợ hỏng.
Đọc văn bản
Tạo giọng không cần âm thanh mẫu. Chọn Giọng có sẵn từ kho, hoặc Giọng ngẫu nhiên để app bốc một chất giọng mới.
.srt.Hội thoại nhóm
Kịch bản nhiều nhân vật, mỗi người một giọng. Viết theo cú pháp <Tên>: lời thoại, rồi gán giọng cho từng tên trong phần Phân vai giọng đọc.
Hợp cho podcast, audio drama, video phỏng vấn — những thứ mà một giọng đọc đều đều nghe rất chán.
Tách phụ đề
Bóc lời nói từ audio hoặc video (MP3, WAV, M4A, FLAC, MP4, MOV…) thành văn bản có mốc thời gian.
- Ngôn ngữ âm thanh — để "Tự nhận diện" cũng được, nhưng chỉ định đúng ngôn ngữ sẽ chính xác hơn với đoạn ngắn.
- Xuất ra .txt thuần hoặc .srt có dấu thời gian để lắp thẳng vào video.
- Kết quả chuyển được sang tab Dịch phụ đề chỉ bằng một nút.
Dịch phụ đề
Dịch file phụ đề bằng LLM mà không phá timing: số dòng và mốc thời gian giữ nguyên tuyệt đối, AI chỉ được đổi phần chữ.
.srt, .vtt, .ass, .sbv và cả .txt thuần. Lấy thẳng kết quả từ tab Tách phụ đề cũng được.Bảng nhất quán
Trước khi dịch, app đọc toàn file để chốt văn phong, thuật ngữ và cách xưng hô, rồi nhét bảng đó vào mọi đoạn dịch. Đây là thứ giữ cho tên riêng và đại từ không nhảy loạn giữa chừng — bạn sửa được bảng này trước khi chạy.
Quản lý Model
Một chỗ quản mọi thứ nặng: model giọng đọc, model nhận dạng, và LLM dùng cho dịch phụ đề.
- 9Router — gateway chạy trên máy, gom nhiều nguồn model về một endpoint.
- Claude CLI · Antigravity · Codex — dùng thẳng gói CLI bạn đã trả tiền, không cần API key riêng.
- Bấm Làm mới sau khi cài xong một CLI để app quét lại và đổ danh sách model.
Webhook API
Bật một server HTTP nội bộ để công cụ khác gọi vào tạo giọng — n8n, Make, Zapier, script Python, hoặc G-Labs Story Machine.
8766, dán URL và khoá API sang Story Machine là xong.Kho giọng nói
Dùng chung cho ba màn hình tạo audio. App đi kèm 30 giọng mẫu (nam/nữ, nhiều chất giọng); giọng bạn tự clone lưu vào đây với tên và mô tả ngắn.
Ghim yêu thích
Bấm ★ để đẩy giọng hay dùng lên đầu danh sách.
Mang sang máy khác
Sao lưu / phục hồi bằng file .vcp — chia sẻ được cho người khác.
Mẹo & xử lý sự cố
Giọng clone ra không giống mẫu
Chín trên mười lần là do văn bản mẫu không khớp âm thanh. Nghe lại mẫu và gõ đúng từng chữ, hoặc bấm AI gợi ý. Mẫu có nhạc nền hay hai người nói chồng nhau cũng làm giọng lệch — cắt lấy 5–10 giây sạch nhất.
App đọc sai ký tự đặc biệt (100%, 25°C, m²…)
Dùng Từ điển phát âm: gõ phiên âm một lần, app nhớ theo từng ngôn ngữ và tự áp dụng lần sau.
Máy không có GPU NVIDIA thì dùng được không
Được. App tự chuyển sang CPU đa nhân (và Apple Silicon dùng MPS). Chậm hơn nhưng không lỗi.
Tách phụ đề bị sai chính tả tên riêng
Đổi sang model lớn hơn (Large v3) và chỉ định đúng ngôn ngữ âm thanh thay vì để tự nhận diện.
Dịch phụ đề bị lệch số dòng
Không xảy ra được — app khoá cứng số dòng và timing. Nếu một dòng dịch hỏng, nó giữ nguyên chữ gốc và gắn cờ ⚠ để bạn sửa tay, thay vì làm lệch cả file.
Story Machine báo chưa cấu hình Voice Studio
Mở màn hình Webhook API, bấm Khởi động server, rồi copy URL + Khoá API dán sang phần cài đặt của Story Machine.