Voice-Pro — AI 语音识别、翻译、多语言配音一站式工具


是什么

基于 Gradio 的 Web 应用,集成了 YouTube 下载 → 音频分离 → 语音识别 → 翻译 → 语音合成(含零样本克隆),一站式多媒体处理。

四大功能

标签页做什么
🎬 Dubbing StudioYouTube 下载 + 人声分离 + 字幕 + 翻译 + TTS 配音,一条龙
📝 Whisper Caption90+ 语言语音识别,支持视频内嵌字幕、词级高亮
🌐 Translate100+ 语言互译,支持字幕文件批量翻译、实时语音翻译
🗣️ Speech GenerationEdge-TTS(400+声音) / kokoro / F5-TTS / CosyVoice 零样本克隆

⚠️ 硬件配置要求(重点)

项目最低推荐
操作系统Windows 10/11 64-bitWindows + NVIDIA GPU(已验证)
GPUNVIDIA 显卡 + CUDA 12.4NVIDIA GPU
显存 VRAM4GB+8GB+(降噪等级 2 需要至少 8GB)
内存 RAM4GB+无特殊要求
存储20GB+ 可用首次下载 CosyVoice2-0.5B 约 9GB
网络必须联网(首次安装)

Mac 用户注意 ⚠️

Mac/Linux 未经验证完全可用。官方明确标注只在 Windows+NVIDIA 环境完全验证。

  • 我的 Mac 没有 NVIDIA GPU(Apple Silicon),无法使用 CUDA
  • 即使能跑 CPU 模式,性能也会大打折扣
  • 要在本地跑的话,得用 Windows 台式机(有 NVIDIA 显卡的那台)

显存不足时的对策

  • 降噪等级降到 0 或 1
  • 计算类型改为 int
  • 免费版处理长度限制 60 秒

安装

git clone https://github.com/abus-aikorea/voice-pro.git
# Windows: 运行 configure.bat → start.bat
# 首次运行会安装依赖 1 小时+(需联网)

启动后访问 http://127.0.0.1:7870

内置名人声音库

  • 英语 37 位:Elon Musk, Sam Altman, Joe Rogan, Jordan Peterson 等
  • 中文 6 位:迪丽热巴、蔡依林、杨幂、赵丽颖 等
  • 韩语 6 位:BTS Jin/RM, IU, 刘在石 等

和同类 SaaS 对比

免费开源,功能对标 ElevenLabs。60 分钟视频处理,同类 SaaS 要 $12-48,Voice-Pro 零成本。

我的情况

  • Mac 端跑不了(无 NVIDIA GPU)
  • Windows 台式机有 NVIDIA 显卡的话可以试试
  • 跟我已有的 faster-whisper / FunASR / Qwen3-TTS 有些功能重叠(STT 和 TTS 部分)
  • 独特价值在于:配音工作室一条龙(YouTube→分离→字幕→翻译→配音)+ 零样本语音克隆

收藏时间

2026-06-09