很多AI配音服务使用起来很方便,但当需求从“偶尔生成几句话”变成长期制作视频旁白、有声内容或批量语音时,云端API计费、音频上传以及模型选择限制就会逐渐变得明显。

yovoice走的是另一条路线。它是一个开源的本地语音创作项目,桌面端支持macOS和Windows,模型下载完成后可以直接在本机进行文字转语音、声音克隆和情绪控制,不需要在每次生成时调用云端TTS接口,也没有按生成字数计算API费用的模式。

从当前项目的发展方向来看,yovoice已经不只是一个输入文字、导出WAV的简单TTS界面。项目把模型管理、参考音频、角色音色、故事配音、字幕导入、音轨编辑、CLI以及Agent Skill逐步整合到同一个工作流中,更接近一个面向本地AI语音创作的桌面工具。

开源AI语音工具yovoice:本地运行、配音制作与Agent调用

yovoice主要解决什么问题

传统本地TTS项目经常需要用户自己准备Python环境、安装推理依赖、下载权重,再通过命令行调整参数。对于只是希望做配音的用户来说,这部分配置本身就可能成为门槛。

yovoice的思路是把这些能力包装成桌面应用。用户可以在设置中准备模型,然后新建“故事配音”或“语音生成”作品,输入文本或导入字幕,选择角色和声音参数后直接生成音频。

这种设计更适合希望保留本地推理能力,又不想从零搭建每一个TTS模型环境的用户。

它主要覆盖几类需求:

  • 把文章、脚本和旁白文字转换成语音。

  • 使用参考录音复刻指定音色。

  • 调整声音的情绪、语气和演绎方式。

  • 为多段文本或字幕分别生成配音。

  • 在本地管理角色、参考声音和生成作品。

  • 通过CLI或AI Agent把语音生成接入自动化流程。

本地运行是项目核心特点

yovoice官方将本地推理作为核心定位。模型第一次下载完成后,语音合成过程可以在本机完成,文稿、参考录音和模型文件默认保存在本地。

官方目前给出的默认数据目录是:

~/.yovoice

作品、音色资产和模型都会保存在这个目录中。官方说明中还特别提到,卸载桌面应用时不会主动删除这里的用户数据,因此更换电脑或者重装前可以自行备份该目录。

需要区分的是,“本地运行”不代表安装全过程都完全不需要网络。首次下载安装包、下载TTS模型以及软件更新时仍然需要联网;Windows系统如果缺少WebView2 Runtime,安装程序也可能需要联网安装对应组件。

目前支持哪些TTS模型

yovoice并没有绑定单一语音模型,而是通过本地推理引擎支持多套TTS方案。不同模型在语言、音色克隆、情绪控制和硬件占用方面存在明显区别。

模型主要用途
IndexTTS 2.0中英文音色克隆、情绪控制、参考演绎
IndexTTS 2.5多语言音色克隆、情绪控制、发音调整
VoxCPM2文字设计音色、音色克隆、参考原文辅助克隆
OmniVoice按属性设计音色、音色克隆、非语言声音标签
Qwen3-TTS Base参考音色克隆和多语言语音生成
Qwen3-TTS CustomVoice使用内置音色,并通过文字控制风格和情绪
Qwen3-TTS VoiceDesign直接通过自然语言描述设计声音,无需参考录音
Kokoro-82M使用内置音色进行轻量语音合成

这意味着选择模型时不能只看“哪个模型更大”。如果已经有参考录音,需要的是声音复刻,可以优先考虑支持音色克隆的模型;如果没有参考声音,只希望用文字描述“成熟、低沉、平静”的声音,则VoiceDesign一类模型更符合需求;如果电脑配置有限,只需要快速进行普通文字转语音,轻量模型的实用性可能更高。

音色克隆不只是复制声音

声音克隆是yovoice比较核心的一部分,但不同模型支持的控制方式并不一样。

用户可以导入或直接录制参考音频,再利用支持克隆的模型生成新的语音。部分模型还可以结合参考音频的原文,提高克隆过程中的控制精度。

除了“像谁说话”,项目还关注“怎么说”。当前支持的部分模型可以通过参考演绎、情绪参数或者自然语言提示词控制表达方式,例如让同一句文字表现得更加平静、开心或者克制。

不过这种能力取决于具体底模。不同模型能够控制的情绪类型、语言和参数并不完全相同,因此不能把某个模型支持的能力理解成所有模型都具备。

故事配音更适合长内容

截至2026年9月29日,yovoice最新公开版本为v0.1.5。这个版本增加了“故事配音”和“语音生成”两类作品,并进一步完善了字幕和音轨工作流。

故事配音模式支持字幕导入、分段生成和可编辑音轨。这类设计比较适合小说、有声内容、剧情视频或者多人角色对白,因为用户不必把整篇文字一次性生成成一个无法调整的大音频文件。

当前版本还加入了音轨裁剪、撤销与重做、混音以及WAV导出,并支持作品归档的导入、导出和状态恢复。

这使得yovoice与单纯的TTS Web界面开始产生明显区别:语音生成只是流程中的一部分,生成之后还能继续对音频片段进行整理和编辑。

角色库适合重复使用音色

长期做视频或有声内容时,经常会重复使用相同的主持人、旁白或者角色声音。如果每次新建作品都重新选择参考音频和声音参数,操作会比较重复。

yovoice目前提供角色库,可以保存并复用音色和声音设置。对于连续制作系列视频、多角色故事或者固定品牌旁白,这种方式可以减少重复配置。

实际价值并不只是“收藏一个声音”,而是把角色声音逐渐变成可以复用的创作资产。

CLI可以接入自动化流程

桌面应用适合手动制作配音,但批量生成时,图形界面并不一定是效率最高的方式。

yovoice同时提供独立CLI,可以在不打开桌面客户端的情况下完成本地语音生成。这意味着开发者可以通过终端脚本处理大量文本,或者把语音合成接入自己的内容生产流程。

例如自动生成视频旁白时,可以先由程序生成脚本,再调用本地CLI完成TTS,最后交给视频处理程序合成。

对于普通用户来说,CLI并不是必须使用的功能;如果只是偶尔制作一段配音,桌面界面已经更加直接。它的价值主要体现在重复任务和自动化流程中。

Agent Skill有什么实际用途

项目还提供了面向AI Agent的yovoice Skill。

它的目标不是增加一种新的语音模型,而是让能够使用工具的AI Agent理解如何配置和调用yovoice CLI。用户可以把文本、参考音频和输出要求交给Agent,由Agent完成本地语音生成流程。

例如可以描述“使用某段参考录音,以平静语气朗读指定文稿并保存为WAV”,Agent再调用CLI执行。

对于已经使用Agent处理字幕、文章、视频脚本等内容的人,这种方式可以减少人工在多个软件之间复制文字和调整命令的操作。

安装前要看电脑平台

yovoice桌面客户端目前明确支持两类系统。

  • macOS 14及以上,需要Apple Silicon,也就是M系列芯片。

  • Windows 10或Windows 11,64位系统。

macOS版本可以使用Metal进行硬件加速。Windows端支持CPU和NVIDIA CUDA,同时提供实验性的Vulkan支持。

模型运行速度和内存、显存需求会随着具体模型和精度变化。项目提供的模型从数百MB到数GB不等,所以“软件能安装”并不代表所有大型模型都能在同一台电脑上获得相同生成速度。

对于配置有限的电脑,更适合先从体积较小的模型测试,而不是一开始就下载所有模型。

基本使用流程并不复杂

如果只是从桌面端开始使用,可以按照官方目前提供的流程操作:

  1. 从GitHub Releases下载对应系统安装包。

  2. 安装并启动yovoice。

  3. 进入设置,下载准备使用的TTS模型。

  4. 新建故事配音或语音生成作品。

  5. 输入文字,或者导入字幕内容。

  6. 选择角色、参考音色及对应声音参数。

  7. 生成语音并进行试听。

  8. 根据需要裁剪、调整或混合音轨。

  9. 完成后导出音频文件。

真正需要花时间的部分往往不是软件操作,而是模型选择和参考音频质量。同一段文字换不同模型、不同参考声音和不同情绪参数,结果可能存在明显差异。

参考资料

  1. yovoice GitHub项目仓库

  2. yovoice项目官方网站

  3. yovoice v0.1.5版本说明

  4. yovoice中文使用说明