Sao chép giọng nói AI
chạy trực tiếp trên máy

4 chế độ trong 1 ứng dụng: Sao chép giọng từ 5–10 giây âm thanh mẫu, Văn bản sang giọng nói theo thuộc tính, Hội thoại nhiều giọng cho podcast/audio drama, và Giọng nói sang văn bản có dấu thời gian. 600+ ngôn ngữ, offline hoàn toàn.

0 Ngôn ngữ
0 Tab tạo audio
100% Offline
voice-studio — features
$ 🔊 Sao chép giọng nói
Nhân bản giọng từ 5–10 giây âm thanh mẫu. Bắt buộc nhập văn bản mẫu (hoặc bấm ✨ AI gợi ý để Whisper tự điền) để clone chuẩn xác, tránh đọc sai hoặc "hallucination".
$ 🎛️ Văn bản sang giọng nói
Tạo giọng mới bằng thuộc tính: Giới tính, Độ tuổi, Cao độ, Phong cách, Khẩu âm — không cần âm thanh mẫu. Hoặc dùng lại giọng đã lưu trong Kho giọng để xử lý batch ngay lập tức.
$ 💬 Hội thoại nhiều giọng
Viết kịch bản nhiều nhân vật theo cú pháp <code><Tên>: lời thoại</code>, gán mỗi nhân vật một giọng riêng từ Kho giọng — phù hợp làm podcast, audio drama, video phỏng vấn. Có nút <b>📋 Mẫu hội thoại chuẩn</b> để xem ví dụ.
$ 📝 Giọng nói sang văn bản
Nhận dạng lời nói từ audio/video (MP3, WAV, M4A, FLAC, MP4, MOV…). Tự tách đoạn theo giọng nói, xuất ra <b>.txt</b> thuần hoặc <b>.srt</b> có dấu thời gian để làm phụ đề.
$ 🌐 Dịch phụ đề bằng LLM
Dịch <code>.srt</code>, <code>.vtt</code>, <code>.ass</code>, <code>.sbv</code> mà <b>không phá timing</b> — số dòng và mốc thời gian giữ nguyên tuyệt đối, AI chỉ đổi phần chữ. App đọc trước toàn file để chốt <b>bảng nhất quán</b> văn phong, thuật ngữ và cách xưng hô.
$ 🗂 Kho giọng + 30 giọng mẫu sẵn
Đi kèm 30 giọng mẫu sẵn (nam/nữ, nhiều chất giọng). Lưu giọng tự tạo với tên + mô tả ngắn, bấm <b>⭐</b> để pin yêu thích lên đầu danh sách. Sao lưu / phục hồi qua file .vcp để chia sẻ giữa các máy.
$ 🔤 Từ điển phát âm cá nhân
Gặp ký tự đặc biệt như <code>100%</code>, <code>25°C</code>, <code>m²</code>, tên thương hiệu? Gõ phiên âm <b>một lần</b>, app nhớ theo từng ngôn ngữ đầu ra và tự áp dụng cho lần sau. Không phải sửa văn bản thủ công nữa.
$ 🎚 Thanh tốc độ + xuất kèm SRT
Player có dropdown tốc độ 0.5x → 2x, file xuất ra giữ đúng tốc độ đó (không bị méo cao độ). Chế độ gộp 1 file tự kèm file <b>.srt</b> cùng tên — tiện lắp vào video luôn.
$ ⚙️ Cài đặt nâng cao
Tinh chỉnh <b>Độ chi tiết</b>, <b>Mức độ bám sát</b>, <b>Tốc độ đọc</b>, <b>Khoảng nghỉ</b> giữa các câu. <b>Số câu đồng thời</b> trong khung Xử lý hàng loạt.
$ 💾 Xuất âm thanh
2 kiểu xuất: <b>Gộp thành 1 file</b> (kèm <b>.srt</b> tự động) hoặc <b>Mỗi câu 1 file riêng</b>. Mỗi dòng trong bảng có nút <b>⬇</b> để tải riêng. Hỗ trợ WAV và MP3.
$ 🧠 Quản lý Model + LLM
Một chỗ quản model giọng đọc, model nhận dạng và LLM. Kết nối <b>9Router</b>, <b>Claude CLI</b>, <b>Antigravity</b> hoặc <b>Codex</b> — dùng thẳng gói CLI bạn đã trả tiền, không cần API key riêng. Mỗi provider có dòng trạng thái và nút <b>Hướng dẫn</b> kèm lệnh cài sẵn.
$ 🔌 Webhook API
Bật server HTTP nội bộ để công cụ khác gọi vào tạo giọng: <b>n8n</b>, <b>Make</b>, Zapier, script Python — hoặc <b>G-Labs Story Machine</b>. Có sẵn khoá API, body JSON mẫu và ví dụ cURL ngay trong app.
$ 🛡 Tự chuyển sang CPU khi cần
Tự kiểm tra GPU có tương thích với model AI hay không. Nếu không (VD card GTX 10-series), ứng dụng tự chuyển sang CPU đa nhân và báo rõ cho bạn biết — không crash với lỗi CUDA khó hiểu.
_
600+ ngôn ngữ Offline 100% GPU NVIDIA / Apple Silicon CPU đa nhân 💬 Hội thoại nhiều giọng ⭐ 30 giọng mẫu sẵn 🔤 Từ điển phát âm 🎚 Tốc độ điều chỉnh được ✨ AI gợi ý văn bản ⬇ Tải riêng từng dòng Phụ đề .srt tự xuất kèm 🌐 Giao diện 9 ngôn ngữ 🌐 Dịch phụ đề bằng LLM 🔌 Webhook API

7 màn hình chính trong app

Đúng cấu trúc giao diện Voice Studio

01 🔊

Sao chép giọng nói

Clone giọng từ 5–10s âm thanh mẫu.

02 🎛️

Văn bản sang giọng nói

Tạo giọng mới từ thuộc tính, không cần mẫu.

03 💬

Hội thoại nhiều giọng

Nhiều nhân vật, mỗi người một giọng. Podcast, audio drama.

04 📝

Giọng nói sang văn bản

Bóc tách lời nói, xuất .txt hoặc .srt.

05 🌐

Dịch phụ đề

Dịch .srt bằng LLM — khoá cứng timing, giữ nguyên số dòng.

06 ⚙️

Quản lý Model

Tải model giọng đọc / nhận dạng, chọn LLM, xem phần cứng.

07 🔌

Webhook API

Bật server nội bộ cho n8n, Make hay Story Machine gọi vào.

🗂

Kho giọng — 30 giọng mẫu sẵn, dùng chung 3 tab tạo audio

App đi kèm <b>30 giọng mẫu sẵn</b> (nam/nữ, nhiều chất giọng). Lưu thêm giọng tự tạo, bấm <b>⭐</b> để pin yêu thích. Dùng được trong cả Sao chép giọng nói, Văn bản sang giọng nói và Hội thoại nhiều giọng. Sao lưu / phục hồi qua file <code>.vcp</code> để chia sẻ giữa các máy.

Nhìn tận mắt

Ảnh chụp trực tiếp từ ứng dụng đang chạy, không phải mockup.

01

Sao chép giọng nói

Mẫu 5–10 giây bên trái, văn bản cần đọc bên phải. <b>Kho giọng nói</b> nằm ngay dưới với 30 giọng mẫu sẵn và giọng bạn tự lưu.

Màn hình Sao chép giọng nói với kho giọng và cài đặt nâng cao
02

Hội thoại nhiều giọng

Viết kịch bản theo cú pháp <code><Tên>: lời thoại</code>, gán mỗi nhân vật một giọng riêng, rồi đẩy cả kịch bản vào <b>hàng chờ tạo</b>.

Màn hình Hội thoại nhóm với phân vai giọng đọc và hàng chờ tạo
03

Dịch phụ đề bằng LLM

Số dòng và mốc thời gian <b>bất biến</b> — AI chỉ được đổi chữ. Có bảng nhất quán chốt văn phong, thuật ngữ và cách xưng hô cho cả file.

Màn hình Dịch phụ đề với bảng nhất quán và bảng kết quả
04

Webhook API

Bật server nội bộ rồi để n8n, Make, script Python — hay <b>G-Labs Story Machine</b> — gọi vào tạo giọng. Có sẵn khoá API, body mẫu và ví dụ cURL.

Màn hình Webhook API với điều khiển server, khoá API và hướng dẫn

Quy trình tạo giọng

Từ mẫu âm thanh đến file WAV / MP3

  1. 🎧 01 Chọn âm thanh mẫu
  2. 02 Nhập văn bản mẫu<br><small>(hoặc ✨ AI gợi ý)</small>
  3. 📋 03 Nhập kịch bản vào bảng
  4. 04 Bắt đầu tạo
  5. 💾 05 Xuất audio<br><small>(hoặc ⬇ tải lẻ)</small>