本地 AI 配音室:Voicebox 上手教程
Voicebox 把语音克隆、配音生成、听写、音频后期和 Agent 语音输出放进一个本地应用里。适合播客、短视频、旁白和个人自动化,但声音克隆必须先拿到授权。


做短视频、播客、有声书,配音链路经常比写稿更烦:一个工具克隆声音,一个工具生成旁白,一个工具剪音频,还要把字幕、降噪、混响再跑一遍。
Voicebox 想把这条链路收进一个本地应用里。它是开源 AI 语音工作室,能做声音克隆、 TTS 生成、听写、音频后期、多轨故事编辑,还能通过 MCP 让 Claude Code 、 Cursor 这类 Agent 开口说话。

它能干什么
Voicebox 的定位很清楚:语音输入和语音输出都在本地电脑里完成。模型、声音样本、录音和历史记录默认留在机器上,适合对素材隐私敏感的人。
它现在支持 7 类 TTS 引擎:
- Qwen3-TTS:支持多语言克隆,可以写“慢一点”“耳语”这类发声要求。
- Qwen CustomVoice:带 9 个预设声音,不一定需要参考音频。
- LuxTTS:轻量,官方说明约 1GB 显存,CPU 也能跑。
- Chatterbox Multilingual:覆盖 23 种语言。
- Chatterbox Turbo:英语场景更快,支持
[laugh]、[sigh]这类表达标签。 - TADA:偏长音频和声音语言模型方向。
- Kokoro:小模型,内置多种预设声音,适合先试流程。
它还带 8 种后期效果:变调、混响、延迟、合唱/镶边、压缩、增益、高通、低通。对普通视频号、小红书、播客片头来说,这些已经能覆盖不少声音修饰场景。

安装方式
如果只是想用桌面应用,优先下载官方安装包。
- macOS Apple Silicon:
https://voicebox.sh/download/mac-arm - macOS Intel:
https://voicebox.sh/download/mac-intel - Windows:
https://voicebox.sh/download/windows - 全部版本:
https://github.com/jamiepine/voicebox/releases/latest
Linux 目前没有预构建桌面包,官方建议按源码方式安装。 Docker 路径可以先跑服务端和 Web UI:
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
docker compose up
Docker 会把服务监听在本机:
http://127.0.0.1:17493
默认配置里,生成音频会挂载到当前目录的 output/,模型缓存和应用数据放进 Docker volume,重启容器后不会丢。
如果想改代码或跑桌面开发版,需要这些环境:Bun 、 Rust 、 Python 3.11+、 Tauri 依赖。仓库里的开发命令是:
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
just setup
just dev
没有 just 的话先装:
brew install just
# 或
cargo install just
第一次怎么用
比较稳的流程是先别急着克隆声音,先用预设声音跑通一遍。
- 打开 Voicebox 。
- 选择一个 TTS 引擎,比如 Kokoro 或 Qwen CustomVoice 。
- 输入一小段中文或英文文案。
- 生成音频,听一下速度、咬字、情绪是否合适。
- 再尝试加一点后期效果,比如轻微压缩和低混响。
确认流程没问题后,再创建自己的声音档案。声音样本尽量干净:少背景噪声、少混响、不要多人说话。录 10 到 30 秒清晰语音,比从视频里硬抠一段嘈杂音频更靠谱。
声音克隆只建议用自己的声音,或者已经拿到明确授权的声音。不要拿同事、主播、客户、亲友的声音随便做样本。技术门槛降低以后,法律和信任成本反而更高。
做短视频配音的流程
可以按这个顺序做:
1. 写好 300 到 800 字脚本
2. 选声音档案
3. 选择 TTS 引擎和语言
4. 生成第一版
5. 调语速、停顿和情绪提示
6. 加压缩、混响或变调
7. 导出音频
8. 放进剪映、Premiere 或 CapCut 对齐画面
如果稿子比较长,Voicebox 会自动按句子切块,再把片段交叉淡入淡出接起来。 README 里写到的上限是 50,000 字符,适合文章、章节、有声书草稿。长稿更要先生成 30 秒样片,确认音色和语速后再跑完整版本。
Chatterbox Turbo 支持表达标签,可以把少量情绪写进文本:
今天这个功能终于能用了。[laugh]
先别急着上云,我们可以先在本机把声音流程跑通。[sigh]
注意:README 说明只有 Chatterbox Turbo 会理解这些标签。其他引擎可能会把 [laugh] 当成普通文本读出来。

做听写和转写
Voicebox 也能做语音输入。按住全局快捷键说话,松开后转成文字。 macOS 上还能把结果直接贴进当前文本框。
它的 STT 使用 Whisper / Whisper Turbo,按平台走 MLX 或 PyTorch 。常见用法:
- 会议后把录音转成文字。
- 用语音输入长段想法,再让本地 LLM 清理口癖和重复。
- 把临时录音保存到 Captures,再复听、重转写或转成声音样本。
这类功能对写公众号也有用:先口述一版粗稿,再清理成文章。比盯着空白文档硬写,阻力小很多。
给 Agent 加一个声音
Voicebox 内置 MCP Server 。任何支持 MCP 的 Agent,都可以调用它来朗读任务完成、问题提示或通知。
Claude Code 的配置示例:
claude mcp add voicebox \
--transport http \
--url http://127.0.0.1:17493/mcp \
--header "X-Voicebox-Client-Id: claude-code"
Cursor 、 Windsurf 、 VS Code 这类 HTTP MCP 客户端可以这样配:
{
"mcpServers": {
"voicebox": {
"url": "http://127.0.0.1:17493/mcp",
"headers": { "X-Voicebox-Client-Id": "cursor" }
}
}
}
它提供 4 个 MCP 工具:
voicebox.speakvoicebox.transcribevoicebox.list_capturesvoicebox.list_profiles
调用示例:
await voicebox.speak({
text: "Tests passing. Ready to merge.",
profile: "Morgan",
personality: true
});
这对长时间跑任务的人很实用。编译完成、测试失败、需要确认时,Agent 可以直接用指定声音提醒你。
API 也能直接用
Voicebox 暴露 REST API 。想把它接进自己的脚本,可以先试这几个接口。
生成语音:
curl -X POST http://127.0.0.1:17493/generate \
-H "Content-Type: application/json" \
-d '{"text": "Hello world", "profile_id": "abc123", "language": "en"}'
让某个声音说话:
curl -X POST http://127.0.0.1:17493/speak \
-H "Content-Type: application/json" \
-H "X-Voicebox-Client-Id: my-script" \
-d '{"text": "Deploy complete.", "profile": "Morgan"}'
转写音频:
curl -X POST http://127.0.0.1:17493/transcribe \
-F "audio=@recording.wav" \
-F "model=whisper-turbo"
查看声音档案:
curl http://127.0.0.1:17493/profiles
适合谁先试
我会优先推荐三类人试:
- 做短视频、播客、课程旁白,需要稳定产出声音素材。
- 经常语音输入、整理会议、口述文章的人。
- 玩本地 Agent 工作流,想让工具有“声音反馈”的人。
它需要你花一点时间配置。第一次运行要下载模型;如果想跑更大的 TTS 或 STT 模型,显卡和内存也会影响体验。 Windows 和 macOS 的安装包更适合普通用户,Linux 用户更适合有一点命令行经验后再上。
我的建议是先用预设声音和短文本试 10 分钟。能顺利生成、能导出、能转写,再考虑声音克隆和 MCP 。语音克隆这件事越方便,越要把授权和使用边界放在前面。
