虚拟歌姬语调制作简易教程
洛叶总结整理了虚拟歌姬语调需要的一些工具和方法,作为对 25 、 26 两年内相关语调活动经验的总结,希望可以给学习者带来帮助。
原文链接:虚拟歌姬语调制作简易教程
前言¶
大家好,我是洛叶,平时会摸鱼调些歌。欢迎关注我的 Bilibili 主页↗。
在正式开始之前,先简单介绍一下什么是“语调”。顾名思义,语调就是让这些原本负责唱歌的家伙能够开口说话。2025、2026 两届 ACG 音乐会的主持音频,均采用语调的方式制作。
本文会简单介绍音乐会中采用的语调制作方法及相关工具。文中可能存在介绍不够详细或内容有误的地方,欢迎大家指出。
阅读提示
如果能提前了解一些调校相关的基础知识和操作,你会更容易理解本文内容,实际操作时也会更加顺畅。
相关资料可以在“USTC 调校小窝”群中查找往期调校课的 PPT,也可以在 Bilibili 搜索调校相关教程。
准备工作¶
开始制作语调之前,需要根据采用的方法准备相应的软件和素材。
传统工具¶
Tytalk 大多用于传统拼接声库,也就是 V 声库。由于我没有实际使用过,因此本文不作详细介绍。
ACE Studio¶
本文主要使用的抽参工具。第一次接触的朋友,可以先通过官方试用判断它是否适合自己的需求,也可以自行在闲鱼等平台寻找非官方购买渠道,但请注意核实授权有效性、账号安全和交易风险。
GPT-SoVITS¶
AI 音色克隆工具,既可以使用公开模型,也可以自行训练模型。
VOCALOID4 编辑器¶
另一种方法是在 VOCALOID4 编辑器中直接调校。@寒天集萤↗ 老师曾在去年的“依言依语”语调活动中编写过相关教程。不过活动群已经解散,我也没有保存当时的 PPT,因此暂时无法附上资料。
如果有朋友仍然保存着相关 PPT,欢迎联系我。经原作者许可后,我会将资料补充到这里。
模型使用提示
下载和使用模型时,请注意模型作者的授权要求、使用范围及署名规则。
具体方法¶
本文主要介绍两种制作方式:使用 ACE Studio 抽取参数后人工修改,或使用 GPT-SoVITS 模型直接生成音频。
A ACE Studio 抽参
控制空间更大 · 需要人工修整
B GPT-SoVITS 生成
操作更简单 · 结果存在随机性
ACE Studio 抽参法¶
2025 年 ACG 音乐会采用的是现有的洛天依模型,以及通过 ACE Studio 抽参制作的乐正绫语调。
3.1.1准备参考音频¶
假设你已经有一段需要制作成语调的文本,首先需要准备一段念出这段文本的参考音频。
如果你希望使用女声声库制作语调,参考音频最好也采用女声。男声音频对歌姬来说往往偏低,抽参后可能出现工程音高线乱飞的情况,从而明显增加后续修改的工作量。
- 人声清晰,环境杂音较少
- 吐字清楚
- 语速和情绪符合预期
- 音高不明显超出目标声库的舒适音域
3.1.2什么是抽参¶
“抽参”可以简单理解为:将音频中的人声转换成 MIDI 音符块,并提取其中的音高变化。
目前我主要推荐 ACE Studio。其他编辑器,例如 Synthesizer V,也有类似功能,但就我个人的使用体验而言,效果并不如 ACE Studio 理想。
除了较好地还原音高,ACE Studio 的抽参功能也能保留一部分说话时的动态。这里可以将“动态”简单理解为声音的抑扬顿挫——说话如果完全没有起伏,听起来通常会不太自然。
3.1.3在 ACE Studio 中进行抽参¶
-
导入音频
将准备好的参考音频直接拖入工程。
-
打开 AI 工具
右键单击音频片段,在菜单中选择“AI 工具”。
-
人声转 MIDI
选择“人声转 MIDI”,等待软件完成处理并检查音符块。
右键单击导入的音频片段,依次选择“AI 工具”与“人声转 MIDI”。

3.1.4判断工程是否可用¶
接下来的操作需要一些基础调校知识,例如音高线绘制、辅音长度调节等。本文不会详细介绍这些基础操作;需要了解时,可以在 ACE Studio 官方账号↗中查找相应教程。
得到初步工程后,首先需要通过自己的耳朵判断它是否可用。如果连最基础的“勉强能听”都达不到,就应当考虑重新抽参或更换参考音频。杂音较多、吐字不清晰,或者音域相差太大,都可能导致效果不理想。
确定工程基本可用后,再进行细节修改。这些修改通常没有完全量化的标准,很多时候需要依靠听感判断问题所在。
3.1.5修改音高¶
语调的音高不需要细致到唱歌调校的程度,但整体走向至少不能出错。
- 第二声通常会出现比较明显的音高上行;
- 第四声通常会出现比较明显的音高下行;
- 字与字之间的衔接也需要特别注意;
- 重音、疑问语气和情绪变化应有相应的音高起伏。
修改没有统一数值标准,最重要的判断依据仍然是你的耳朵。当某一段听起来奇怪时,可以尝试调整音高线:上移效果不好,就试试下移;变化太大,就将曲线画得平缓一些,直到听感更加自然。
3.1.6修改动态和响度¶
ACE Studio 偶尔会出现抽参结果不稳定的情况,因此可能产生音量不统一的问题。可以使用响度参数,将音量突然变大或变小的部分调整到与前后内容接近的水平。
不必追求波形完全一致,重点是避免明显突兀,并保留正常说话应有的强弱变化。
3.1.7调整辅音和元音长度¶
辅音和元音长度同样以听感为主。如果某个字听起来含糊、拖沓或衔接不自然,可以检查:
- 辅音是否太短,导致吐字不清;
- 辅音是否太长,导致发音生硬;
- 元音是否拖得太久;
- 相邻音符之间是否存在不自然的空隙或重叠。
调整后建议反复试听,并结合前后句判断,而不是只听单个字。
3.1.8导出成品¶
完成修改后,就可以从 ACE Studio 中导出音频,得到需要的语调成品。
2025 年 ACG 音乐会语调工程
仅供学习和交流使用,严禁未经许可进行二次发表。
GPT-SoVITS 生成法¶
GPT-SoVITS 是一种更加简便的方法。通常只需要准备好相关模型,通过简单操作就能得到质量不错的音频,比 ACE Studio 抽参方便不少。
不过众所周知我们中术是冷门圈子,目前流传较广的公开模型主要是洛天依,其他歌姬的公开模型很少。
在 2026 年 ACG 音乐会开始前,在 @wingtings↗ 的协助下,我们将上一年纯手工制作的乐正绫主持音频训练成了模型。虽然仍有一些瑕疵,但它已经能够相对稳定地达到这两届音乐会主持音频的效果,我认为在大部分使用场景中已经足够。
使用时请尽量注明模型来源,虽然不标注的话,我大概也发现不了(x)。
VOICE MODEL · V2 PRO
乐正绫 GPT-SoVITS 模型
夸克网盘提取码:
Vmit。如果觉得网盘下载麻烦,也可以联系我直接发送。
3.2.1基本使用流程¶
本文不会详细介绍 GPT-SoVITS 的安装和具体操作,只简单说明语调制作流程。无论是使用公开模型,还是自己训练模型,都可以在 Bilibili 找到相应教程。
最常见的操作就是反复生成音频。你可以把这个过程理解成“抽卡”:不断重新生成,直到得到比较满意的结果。也可以修改部分参数后重新生成。整体而言,这是一个操作简单但可能比较耗时的过程。
3.2.2长句效果不好时¶
如果反复生成仍然无法得到满意的音频,可以先尝试缩短句子。长句或结构复杂的句子,生成效果往往不如短句稳定。
可以将长句拆成几段分别生成,然后在宿主软件或音频编辑器中重新合并。合并时,需要重点注意句子之间的停顿时长,避免停顿过长或过短。
3.2.3外语单词念错时¶
生成英文等外语内容时,可能会出现单词读错或发音不清的情况。例如,ACG 音乐会的语调中就遇到过 ACG、VOCALOID 等单词的发音问题。
这时可以采用“拆开生成,最后合并”的方法。以 VOCALOID 为例,可以尝试分别生成 vocal 和 loid。虽然后者不是常规英文单词,但只要最终读音符合需要,就可以作为合成素材使用。
生成完成后,删去 vocal 尾部多余的声音,再将两段音频拼接起来。仔细听可能仍有瑕疵,但通常会比直接生成整个单词有明显改善。
类似的误读在中文中也可能出现。因此,你需要充分发挥想象力,通过换字、拆字、调整断句或重新拼接等方式,凑出一段令自己满意的音频。
后期处理¶
大多数情况下,语调的后期处理要求并不高,因为通常只有人声,没有伴奏。主要需要注意以下两点。
平衡整体音量¶
尽量让整段音频的音量保持稳定,消除突兀变化,同时保留正常说话时的轻重和情绪起伏。
调整句子间隔¶
间隔太长会让语气断裂,太短则显得拥挤。建议结合语义、标点和情绪进行调整,并完整播放检查。
总结¶
以上就是我个人总结的一些语调制作经验。
简单来说,ACE Studio 抽参法需要更多人工修改,但控制空间更大;GPT-SoVITS 生成法操作更加简单,但生成结果存在一定随机性,有时需要多次尝试和后期拼接。
如果你对语调制作感兴趣,欢迎亲自尝试。实际操作过程中遇到问题,也可以随时联系我交流。
相关资源¶
教程与主页¶
- 洛叶的 Bilibili 主页↗
- 寒天集萤的 Bilibili 主页↗
- ACE Studio 的 Bilibili 主页↗
- wingtings 的 Bilibili 主页↗
- GPT-SoVITS 使用教程↗
下载资源¶
- 2025 ACG 音乐会语调工程 ↓
- 乐正绫 GPT-SoVITS 模型↗提取码:Vmit;下载不便可联系作者。
资源使用说明
上述工程和模型仅供学习与交流使用。转载、二次发布或用于其他项目前,请先阅读相应资源的授权说明;需要获得许可的,请提前联系作者。