Voicebox 0.5.0 for Mac:开源本地优先的AI语音工作室

Voicebox 0.5.0

软件介绍

Voicebox是一款开源、本地优先的AI语音工作室,可在Mac上完整运行,作为ElevenLabs和WisprFlow的免费替代方案。它把语音输入和输出闭环都放在同一台机器上完成,不依赖云端、无需账户,模型、音频、转录内容和LLM输出都不会离开设备。用户可以从几秒参考音频中进行零样本语音克隆,或使用50多个精选预设语音,通过七种TTS引擎生成语音,支持23种语言。这些引擎包括Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA和Kokoro,每种引擎可按生成任务切换。应用还提供多轨时间轴编辑器用于对话、播客或叙事,支持后期处理效果如音高偏移、混响、延迟、合唱、压缩和滤波,以及副语言标签和自然语言表达控制。语音可无限长度自动分块并交叉淡入淡出。内置REST与WebSocket API以及MCP服务器,方便集成到其他应用或智能体。Mac上支持Apple Silicon的MLX(Metal)后端,通过神经引擎可获得4到5倍加速,也兼容Intel机型,最低要求macOS 11+、8GB内存和5GB可用存储。

Voicebox 0.5.0 for Mac 破解版下载

0.5.0版本更新内容

0.5.0被称为Capture发布版,于2026年4月22日推出。此前Voicebox主要是语音克隆工作室,这一版让它升级为完整的AI语音工作室。用户可在机器任意位置按住自定义组合键说话后松开,转录结果就会干净地落入当前焦点文本框。反过来,任何支持MCP的智能体也能通过屏幕上的提示气泡,用你克隆的声音开口说话。两者之间有一个本地LLM负责清理转录,并让语音配置文件携带性格,在发声前重塑内容。

听写功能

全局热键捕获是核心新增。Mac默认使用右Command加右Option,按住说话、松开即可。屏幕浮现的提示气泡依次显示录音、转录、润色到完成,并带实时计时。支持按住说话和切换两种模式,各自独立组合键。默认切换键在按住说话组合上再加空格,按住说话中途点空格可无缝转成免提。转录结束后会自动粘贴到启动组合键时聚焦的文本框,即使过程中焦点移动也不影响,剪贴板会先保存再恢复,兼容Dvorak和AZERTY布局。设置里的捕获页提供组合键选择器,按住想要的键即可自定义,左右修饰键会有标记。Mac默认避开左手Command加Option,以免与系统快捷键冲突。如果未授予辅助功能权限,听写和转录仍可进行,结果会落在捕获标签页,只是自动粘贴被禁用,权限提示就在自动粘贴开关旁边。

语音性格与智能体联动

语音配置文件现在可添加可选性格描述,最长2000字符。设置后生成按钮旁会出现两个新控件:洗牌按钮用本地Qwen3 LLM生成符合性格的新句子,点击可换一批再编辑;角色说话开关则在TTS前先让输入文本按性格改写,保留原意但换上角色口吻。同一个本地LLM同时负责性格和转录润色。内置MCP服务器监听本地17493端口,Claude Code、Cursor、Windsurf、Cline或VS Code MCP扩展都可调用。提供四个工具:用指定语音配置文件说话并可启用性格、转录本地音频或文件、列出最近捕获、列出可用配置文件。支持HTTP主传输和stdio旁路,设置页可按客户端绑定默认语音,屏幕提示气泡会显示智能体发声状态。

捕获标签页、润色与故事编辑器

捕获标签页成为听写设置中心,集中管理全局快捷键、组合键、自动粘贴、Whisper模型选择、语言锁定、自动润色开关、润色模型以及默认播放语音。润色阶段用本地Qwen3 LLM去掉填充词、修正标点,可选重写自我纠正,并在LLM处理前先折叠Whisper幻觉循环。模型可选0.6B、1.7B或4B。故事标签页从简单TTS序列器升级为真正时间轴编辑器,可拖入外部音频文件(支持wav、mp3等常见格式,最大200MB),每个片段独立音量调节,支持拆分、复制、重新生成,轨道可上下添加,缩放范围从10秒到整个项目。

界面新增主题选择(浅色、深色或跟随系统),捕获详情卡带波形播放器可点击定位,准备就绪检查清单会显示模型、权限等状态。Windows端也实现了完整听写流程。应用用Tauri构建,首次启动时会自动下载所选TTS模型,语音配置文件和生成音频保存在Mac的Application Support目录下。

Related Posts

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注