For the complete documentation index, see llms.txt. This page is also available as Markdown.

为歌声合成克隆歌手声线

在 ACE Studio 中,将你自己的声线克隆为歌声合成歌手。

什么是歌声合成克隆?

这是一项通过上传你的人声素材来自定义你自己的歌声合成模型的功能。AI 会根据你上传的素材学习音色和演唱风格,并克隆出你歌手声线的数字版本。

完成自定义后,你就可以像在 ACE Studio 中使用我们预设的 AI 声线一样,用你的歌手来根据 MIDI 和歌词生成歌声。

如何为歌声合成克隆我的声音?

准备数据集

干声歌声

高质量声线需要干净的干声歌声素材:

  • 不含任何混响、延迟或合唱效果

  • 不含背景噪声

  • 不含伴奏或任何非人声声音

  • 不含任何和声或人声叠录

建议每个声线提供 30–100 分钟的演唱人声素材。您提供的素材越多,AI 能学习到的演唱细节就越丰富;但超过 120 分钟后,额外素材带来的收益会逐渐减少。

房间反射声

带有较强房间反射声录制的歌声可能导致识别错误,并造成模型表现不符合预期。

来自音轨分离的歌声

使用人声消除器或音轨分离获取歌声时,输出质量可能受损,低至无法用于训练。为获得更高质量的声线模型,请尽量使用音轨分离得到的歌声。

录制素材

高品质麦克风与音频接口

专业麦克风配合音频接口可录制高质量歌声。您还需要录音软件来连接接口,并录制、编辑和混音您的歌声。

为声线模型录音时,请避免使用并非为演唱设计的麦克风:

  • 手机或笔记本电脑麦克风

  • 领夹式或头戴式麦克风

  • KTV 麦克风

  • 耳机麦克风或 AirPods 等蓝牙耳机(通常用于手机通话)

录音环境

  1. 不需要的背景噪声可能包括交谈声、电流嗡声与杂音、交通及户外噪声,以及配件或物体移动产生的声音。为避免这些噪声干扰录音,选择安静的地点非常重要。请选择能够尽量减少或消除意外噪声干扰的场所。

  2. 硬质、平整的表面会造成声音反射,使录音产生混响或回声。这会令您的轨道听起来空洞或遥远,削弱所需的亲密感与清晰度。

  3. 尝试在房间内用力拍手并仔细聆听。如果听到颤动声或持续较长的回声,则表明存在混响问题。

  4. 为解决此问题,请加入可吸收声音的柔和材质。可考虑使用地毯、垫毯或厚窗帘,以显著减少反射声。覆盖硬质地面、尽可能在窗户上悬挂窗帘,并在房间中摆放带有布艺覆盖的家具,都会有所帮助。

  5. 避免使用硬质表面,因为它们会加剧问题。如果无力购买专业吸音板,可利用画布画作、挂毯或泡沫砖等日常物品来打散这些表面。

  6. 设置麦克风时,请注意其摆放位置。避免将其放得太靠近墙壁或置于角落。建议放在房间中央,或尝试不同位置,找出混响最少的最佳录音点。

耳机串音

录音时,特别是录制歌声时,耳机中的音频串入麦克风是很常见的情况。当耳机音量过高,或使用开放式耳机时,就可能出现此问题。这在歌曲录制中或许可以接受,但在为声线模型录音时应尽量避免这种串音。

麦克风摆位

以正常音量演唱时,建议与麦克风保持约 2 英寸的距离。但对于较响的乐句或强声演唱,建议将距离增加至约 4–6 英寸。请注意,为保持最佳音频拾取效果,您应始终与麦克风保持在 12 英寸以内。

为强声演唱预留空间

使用强声演唱技巧时,无论是与麦克风的距离,还是所在房间的大小,都应为自己预留充足空间。过度隔音,例如身处衣柜或录音棚隔间,或用泡沫材料包围麦克风,都很容易导致麦克风振膜过载。如不确定,演唱强声乐句时建议保留更多房间声。

演唱语言

基础自定义槽位

在基础自定义槽位下训练的你的歌手模型只支持一种演唱语言。

专业自定义槽位

在专业自定义槽位下训练的你的歌手可以支持多语言。

素材中的语言

在训练过程中,每个素材文件都会被单独处理,并视为单语言文件。务必避免在同一个素材文件中混入不同语言的短语。

上传素材时,请确保将其放在对应的语言标签下。即使你上传的是基础自定义槽位的素材,必要时也可以上传不同语言的素材。按语言整理素材有助于保持清晰,并提升训练流程。

即将支持的语言

我们正在持续开发用于自定义歌手功能的新演唱语言。

对于你的新歌手:

  • 新语言将通过新的专业自定义槽位支持。

  • 新语言将作为新的基础自定义槽位可支持的选项之一。

对于你现有的歌手:

  • 重新训练你的专业自定义槽位时,将支持新语言。

  • 重新训练你的基础自定义槽位时,新语言将作为可选项。

演唱或语音

歌唱素材和语音素材都可以用于训练你的演唱声线模型。

你的歌手模型可以学习:

  • 来自歌唱素材和语音素材的音色;但请注意:对于人来说,说话音色可能与演唱音色不同,通常不能代表真实的演唱表现。

  • 来自歌唱素材的演唱风格

你的歌手模型无法学习:

  • 来自语音素材的演唱风格

文件质量设置

素材的音频质量会直接影响您的声线质量。

建议将音频质量设置为:

  • 位深 = 16 位

  • 采样率 = 44.1 kHz 或 48 kHz

  • 无损文件格式(.wav 或 .flac)

后期处理

为保持目标声线的自然特质与清晰度:

  • 不要重叠: 多层人声会增加 AI 分析的复杂度。请将重叠的录音置于后方,并坚持使用单一人声轨道,以确保 AI 能够准确处理并从您的素材中学习。

  • 不要硬切: 硬切会造成突兀的起始或结束,这不符合自然演唱的声音特征,也可能引入咔嗒声或爆音。请在人声片段的开头和结尾使用平滑淡化,以获得更自然的过渡。

  • 不要重复片段: 重复的片段无助于训练。声线模型将受益于演唱表现中的自然变化。

  • 控制音量: 请确保素材音量维持在电平表约 30–50% 的范围内。使用音量骑乘或自动化,确保整个数据集的音量电平保持一致。目标是在整段录音中建立稳定的音量电平,同时保留各片段内部的动态变化。

训练您的声线

准备好数据集后,您可以前往 自定义声线页面 选择一个自定义槽位,上传你的人声素材,然后开始训练。

基础自定义槽位会为你带来一个单语言歌手,共 5 个版本。

专业自定义槽位会为你带来一个多语言歌手,共 5 个版本。

点击槽位即可开始上传素材。

所有素材上传完成后,训练将自动开始。你可以通过刷新网页查看状态。

当你看到训练页面切换为声音克隆管理页面时,说明你的歌手已设置完成。它会显示在 ACE Studio 的歌手库中。如果看不到,请尝试重新启动 ACE Studio。

专业提示

如果你希望某个歌手拥有独特的表现和个性,例如在不同音域或情绪下获得最佳效果,最好将素材拆分给多个声线。

例如:

Mike 是一位职业歌手,想要自定义自己的歌手声线。他既能胜任男高音,也能胜任贝斯。因此最好训练 2 个声线:

  • 基于大多为高音且有力量感的表演素材,训练一个高音且有力量感的声线。

  • 基于大多为低音短句的素材,训练一个贝斯声线。

重新训练您的声线

点击 重新训练 按钮以重新训练您的声线。

重新训练将移除该槽位下你之前的歌手,并撤下所有与该歌手关联的已部署歌手。AI 将使用新的数据集从零开始训练一个全新的歌手。在启动重新训练之前,你可以选择保留该槽位中的历史素材并继续上传新的素材,或者清空历史素材,仅使用新上传的素材。

准备新素材时,请注意:

  • 如果新添加素材的音符时长明显少于已上传素材,例如在 30 分钟的数据集中只新增 1 分钟素材,那么重新训练可能不会让歌手的表现出现显著变化。

  • 重新训练不会改变槽位的类型。

  • 你可以通过重新训练来切换基础自定义槽位所支持的语言。

何时应重新训练我的声线?

  • 当你的数据集质量更高或数量更多时,你可以利用它们迭代提升你的歌手模型。

  • 当您对当前结果不满意,并希望调整数据集时

  • 当新的演唱语言能力发布时

管理您的声线

版本

AI 会从你的数据中逐步学习,并按步骤分析每个素材。随着学习深入,训练步数会增加。使用较小或质量有限的数据集进行训练,例如并非为歌唱而设计、而是用于语音的数据集,可能只需要少量步数。相比之下,更大且更多样化的数据集可能需要更多步数才能充分拟合。不过,过多的训练步数会导致过拟合,进而可能以不可预测的方式降低你的歌手表现。

训练结束后,你会根据不同训练步数获得多个版本,范围从偏少到充分。你可以通过切换部署并相互对比,找到最佳版本。

声线混合

混合声线会生成一个混合声线。你可以通过调整混合声线的比例,让你的声线更接近目标声线。为此,请进入槽位管理页面,并点击每个版本下方的‘声线混合’按钮。

混合后,你的声线将采用新的声线特征。要应用这些更改,你需要通过重启 ACE Studio 刷新你的声线。

部署到 ACE Studio

对于基础自定义槽位和专业自定义槽位,在部署某个版本后,你可以将部署从一个版本切换到另一个版本。每次部署后都需要重新启动 ACE Studio,以刷新你的声线库。

最后更新于