HƯỚNG DẪN SỬ DỤNG

Voice Studio từ A đến Z

Toàn bộ ảnh trong trang này chụp trực tiếp từ ứng dụng đang chạy. Voice Studio làm việc hoàn toàn offline — model chạy trên máy bạn, không gửi âm thanh đi đâu cả.

Cửa sổ chính G-Labs Voice Studio: thanh bên bảy mục và tab Sao chép giọng
Cửa sổ chính. Thanh bên trái là bảy màn hình chức năng; phần dưới có Log chi tiết, Cài đặt và trạng thái gói.

Voice Studio là gì

Một ứng dụng desktop chạy model giọng nói ngay trên máy bạn. Không cần internet để tạo tiếng, không có phí theo ký tự, và âm thanh không rời khỏi máy.

🔊

Tạo giọng

Sao chép giọng từ mẫu ngắn, hoặc tạo giọng mới bằng thuộc tính.

💬

Nhiều nhân vật

Kịch bản hội thoại, mỗi nhân vật một giọng riêng.

📝

Phụ đề

Bóc lời từ audio/video, rồi dịch phụ đề bằng LLM.

Máy yếu vẫn chạy được: app tự kiểm tra GPU; card không tương thích thì tự chuyển sang CPU đa nhân và báo rõ, thay vì crash với lỗi CUDA khó hiểu.

Cài đặt & nạp model

Lần chạy đầu tiên cần tải model về máy. Vào Quản lý Model ở thanh bên, tải gói giọng đọc (TTS) — bắt buộc — và ít nhất một model nhận dạng nếu bạn định tách phụ đề.

Màn hình Quản lý Model: trạng thái model TTS và các model nhận dạng kèm dung lượng
Mỗi model ghi rõ dung lượng và VRAM cần. Model đã có sẽ hiện ✓ Đã tải về máy; chưa có thì bấm Tải.
Nên để model trên ổ SSD. App khởi động sẽ nạp model vào RAM/VRAM — để trên HDD thì mỗi lần mở app chờ rất lâu.
MÀN HÌNH 01

Sao chép giọng

Nhân bản một giọng từ 5–10 giây âm thanh mẫu. Đây là màn hình mặc định khi mở app.

  • Tệp âm thanh mẫu — kéo thả hoặc chọn file. Mẫu càng sạch (không nhạc nền, không nhiều người nói) thì giọng clone càng giống.
  • Văn bản mẫu (bắt buộc) — gõ lại chính xác lời nói trong mẫu. Sai một chữ cũng làm giọng lệch. Không muốn gõ tay thì bấm AI gợi ý để Whisper tự điền.
  • Nội dung văn bản — nhập câu cần đọc bằng giọng vừa clone, mỗi dòng một câu.
Tab Sao chép giọng: ô chọn tệp mẫu, văn bản mẫu, cài đặt nâng cao và Kho giọng nói
Bên trái là mẫu và cài đặt, bên phải là bảng nội dung cần đọc cùng trình phát thử.

Cài đặt nâng cao

Độ chi tiết (số bước sinh), Mức độ bám sát (bám mẫu chặt hay thoáng) và Tốc độ đọc. Mỗi ô có nút ↺ để trả về mặc định — cứ thử, không sợ hỏng.

MÀN HÌNH 02

Đọc văn bản

Tạo giọng không cần âm thanh mẫu. Chọn Giọng có sẵn từ kho, hoặc Giọng ngẫu nhiên để app bốc một chất giọng mới.

Tab Đọc văn bản: chọn giọng có sẵn hoặc ngẫu nhiên, bảng nội dung và các nhóm cài đặt
Chọn giọng từ kho rồi dán kịch bản vào bảng — phù hợp khi cần xử lý hàng loạt câu.
Đây là màn hình hợp lý nhất để xử lý hàng loạt: một giọng cố định, nhiều câu, xuất ra từng file hoặc gộp một file kèm .srt.
MÀN HÌNH 03

Hội thoại nhóm

Kịch bản nhiều nhân vật, mỗi người một giọng. Viết theo cú pháp <Tên>: lời thoại, rồi gán giọng cho từng tên trong phần Phân vai giọng đọc.

Tab Hội thoại nhóm: khu nhập kịch bản, phân vai giọng đọc và hàng chờ tạo
Có nút Mẫu hội thoại chuẩn để xem đúng định dạng, và Phân tích hội thoại để app tự tách nhân vật.

Hợp cho podcast, audio drama, video phỏng vấn — những thứ mà một giọng đọc đều đều nghe rất chán.

MÀN HÌNH 04

Tách phụ đề

Bóc lời nói từ audio hoặc video (MP3, WAV, M4A, FLAC, MP4, MOV…) thành văn bản có mốc thời gian.

Tab Tách phụ đề: chọn tệp, chọn model nhận dạng và bảng kết quả trích xuất
Model nhận dạng chọn theo máy: Turbo nhanh và đủ tốt cho hầu hết việc; Large v3 chính xác nhất nhưng nặng nhất.
  • Ngôn ngữ âm thanh — để "Tự nhận diện" cũng được, nhưng chỉ định đúng ngôn ngữ sẽ chính xác hơn với đoạn ngắn.
  • Xuất ra .txt thuần hoặc .srt có dấu thời gian để lắp thẳng vào video.
  • Kết quả chuyển được sang tab Dịch phụ đề chỉ bằng một nút.
MÀN HÌNH 05

Dịch phụ đề

Dịch file phụ đề bằng LLM mà không phá timing: số dòng và mốc thời gian giữ nguyên tuyệt đối, AI chỉ được đổi phần chữ.

Tab Dịch phụ đề: nhập tệp, chọn ngôn ngữ đích, bảng nhất quán và bảng kết quả dịch
Nhận .srt, .vtt, .ass, .sbv và cả .txt thuần. Lấy thẳng kết quả từ tab Tách phụ đề cũng được.

Bảng nhất quán

Trước khi dịch, app đọc toàn file để chốt văn phong, thuật ngữ và cách xưng hô, rồi nhét bảng đó vào mọi đoạn dịch. Đây là thứ giữ cho tên riêng và đại từ không nhảy loạn giữa chừng — bạn sửa được bảng này trước khi chạy.

Cần chọn model LLM trước ở Quản lý Model. Dùng được Claude CLI, Antigravity, Codex hoặc gateway 9Router.
MÀN HÌNH 06

Quản lý Model

Một chỗ quản mọi thứ nặng: model giọng đọc, model nhận dạng, và LLM dùng cho dịch phụ đề.

Màn hình Quản lý Model: model AI, khu LLM với 9Router, Claude CLI, Antigravity và Codex
Khu LLM ở dưới: mỗi provider có dòng trạng thái riêng và nút Hướng dẫn kèm lệnh cài sẵn để copy.
  • 9Router — gateway chạy trên máy, gom nhiều nguồn model về một endpoint.
  • Claude CLI · Antigravity · Codex — dùng thẳng gói CLI bạn đã trả tiền, không cần API key riêng.
  • Bấm Làm mới sau khi cài xong một CLI để app quét lại và đổ danh sách model.
MÀN HÌNH 07

Webhook API

Bật một server HTTP nội bộ để công cụ khác gọi vào tạo giọng — n8n, Make, Zapier, script Python, hoặc G-Labs Story Machine.

Màn hình Webhook API: điều khiển server, khoá API và hướng dẫn sử dụng kèm ví dụ JSON
Bật server, copy Khoá API và URL — bên dưới có sẵn hướng dẫn, body JSON mẫu và ví dụ cURL.
Đây chính là cách Story Machine lấy giọng đọc: bật server ở cổng 8766, dán URL và khoá API sang Story Machine là xong.

Kho giọng nói

Dùng chung cho ba màn hình tạo audio. App đi kèm 30 giọng mẫu (nam/nữ, nhiều chất giọng); giọng bạn tự clone lưu vào đây với tên và mô tả ngắn.

Ghim yêu thích

Bấm để đẩy giọng hay dùng lên đầu danh sách.

Mang sang máy khác

Sao lưu / phục hồi bằng file .vcp — chia sẻ được cho người khác.

Mẹo & xử lý sự cố

Giọng clone ra không giống mẫu

Chín trên mười lần là do văn bản mẫu không khớp âm thanh. Nghe lại mẫu và gõ đúng từng chữ, hoặc bấm AI gợi ý. Mẫu có nhạc nền hay hai người nói chồng nhau cũng làm giọng lệch — cắt lấy 5–10 giây sạch nhất.

App đọc sai ký tự đặc biệt (100%, 25°C, m²…)

Dùng Từ điển phát âm: gõ phiên âm một lần, app nhớ theo từng ngôn ngữ và tự áp dụng lần sau.

Máy không có GPU NVIDIA thì dùng được không

Được. App tự chuyển sang CPU đa nhân (và Apple Silicon dùng MPS). Chậm hơn nhưng không lỗi.

Tách phụ đề bị sai chính tả tên riêng

Đổi sang model lớn hơn (Large v3) và chỉ định đúng ngôn ngữ âm thanh thay vì để tự nhận diện.

Dịch phụ đề bị lệch số dòng

Không xảy ra được — app khoá cứng số dòng và timing. Nếu một dòng dịch hỏng, nó giữ nguyên chữ gốc và gắn cờ ⚠ để bạn sửa tay, thay vì làm lệch cả file.

Story Machine báo chưa cấu hình Voice Studio

Mở màn hình Webhook API, bấm Khởi động server, rồi copy URL + Khoá API dán sang phần cài đặt của Story Machine.