Voice-Pro — AI 语音识别、翻译、多语言配音一站式工具
- GitHub: abus-aikorea/voice-pro
- 作者: ABUS(韩国创业公司)/ abus.aikorea@gmail.com
- Stars: 10,700+ | License: GPL-3.0 | 最新: v3.2.0
- 栈: Python 93.9% + Gradio WebUI + PyTorch 2.5.1 + CUDA 12.4
是什么
基于 Gradio 的 Web 应用,集成了 YouTube 下载 → 音频分离 → 语音识别 → 翻译 → 语音合成(含零样本克隆),一站式多媒体处理。
四大功能
| 标签页 | 做什么 |
|---|---|
| 🎬 Dubbing Studio | YouTube 下载 + 人声分离 + 字幕 + 翻译 + TTS 配音,一条龙 |
| 📝 Whisper Caption | 90+ 语言语音识别,支持视频内嵌字幕、词级高亮 |
| 🌐 Translate | 100+ 语言互译,支持字幕文件批量翻译、实时语音翻译 |
| 🗣️ Speech Generation | Edge-TTS(400+声音) / kokoro / F5-TTS / CosyVoice 零样本克隆 |
⚠️ 硬件配置要求(重点)
| 项目 | 最低 | 推荐 |
|---|---|---|
| 操作系统 | Windows 10/11 64-bit | Windows + NVIDIA GPU(已验证) |
| GPU | NVIDIA 显卡 + CUDA 12.4 | NVIDIA GPU |
| 显存 VRAM | 4GB+ | 8GB+(降噪等级 2 需要至少 8GB) |
| 内存 RAM | 4GB+ | 无特殊要求 |
| 存储 | 20GB+ 可用 | 首次下载 CosyVoice2-0.5B 约 9GB |
| 网络 | 必须联网(首次安装) | — |
Mac 用户注意 ⚠️
Mac/Linux 未经验证完全可用。官方明确标注只在 Windows+NVIDIA 环境完全验证。
- 我的 Mac 没有 NVIDIA GPU(Apple Silicon),无法使用 CUDA
- 即使能跑 CPU 模式,性能也会大打折扣
- 要在本地跑的话,得用 Windows 台式机(有 NVIDIA 显卡的那台)
显存不足时的对策
- 降噪等级降到 0 或 1
- 计算类型改为 int
- 免费版处理长度限制 60 秒
安装
git clone https://github.com/abus-aikorea/voice-pro.git
# Windows: 运行 configure.bat → start.bat
# 首次运行会安装依赖 1 小时+(需联网)启动后访问 http://127.0.0.1:7870
内置名人声音库
- 英语 37 位:Elon Musk, Sam Altman, Joe Rogan, Jordan Peterson 等
- 中文 6 位:迪丽热巴、蔡依林、杨幂、赵丽颖 等
- 韩语 6 位:BTS Jin/RM, IU, 刘在石 等
和同类 SaaS 对比
免费开源,功能对标 ElevenLabs。60 分钟视频处理,同类 SaaS 要 $12-48,Voice-Pro 零成本。
我的情况
- Mac 端跑不了(无 NVIDIA GPU)
- Windows 台式机有 NVIDIA 显卡的话可以试试
- 跟我已有的 faster-whisper / FunASR / Qwen3-TTS 有些功能重叠(STT 和 TTS 部分)
- 独特价值在于:配音工作室一条龙(YouTube→分离→字幕→翻译→配音)+ 零样本语音克隆
收藏时间
2026-06-09