For the complete documentation index, see llms.txt. This page is also available as Markdown.

为歌声合成克隆声音

在 ACE Studio 中将你自己的声音克隆为歌声合成声线。

什么是歌声合成克隆?

这是一项通过上传你的歌声素材来定制专属歌声合成模型的功能。AI 将根据你上传的素材学习音色和演唱风格,并克隆出你的数字化歌手版本。

定制完成后,你就可以像在 ACE Studio 中使用我们预置的 AI 声线一样,用你的歌手通过 MIDI 和歌词生成歌声。

如何为歌声合成克隆我的歌手?

准备你的数据集

干净的干声

高质量的歌手需要干净、干声的歌声素材:

  • 不要带任何混响、延迟或合唱效果

  • 不要有背景噪音

  • 不要有人声伴奏或任何非人声音效

  • 不要有任何和声或叠声

建议每个歌手准备 30-100 分钟的歌唱歌声素材。你提供的素材越多,AI 能学习到的歌唱细节就越多,但当时长超过 120 分钟后,收益会变得有限。

房间反射

带有明显房间反射的歌声,可能会导致识别错误,并让模型表现出现偏差。

来自音轨分离的歌声

当你使用人声去除器或音轨分离处理歌声时,输出质量可能会损失到不适合训练的程度。若想获得更高质量的歌手模型,建议可选使用来自音轨分离的歌声。

录音素材

搭配音频接口的高品质麦克风

专业麦克风搭配音频接口,可以录到高质量的歌声。你还需要录音软件来连接接口,并对歌声进行录制、编辑和混音。

在录制歌手模型时,请避免使用并非为演唱而设计的麦克风:

  • 手机或笔记本麦克风

  • 领夹麦克风或耳机麦克风

  • 卡拉 OK 麦克风

  • 耳机麦克风或蓝牙耳机,例如 AirPods(这些通常用于通话)

录音环境

  1. 不需要的背景噪音可能包括人声交谈、电流嗡鸣和杂音、交通和室外噪音,以及配件或物体移动的声音。为了防止这些噪音干扰录音,选择一个安静的地点非常重要。请尽量选择能够将意外噪音干扰降到最低,甚至完全消除的地方。

  2. 由于硬质平面表面的存在,声音反射可能会产生,从而在录音中形成混响或回声。这会让你的轨道听起来空洞或距离感过强,削弱所需的亲密感和清晰度。

  3. 你可以在房间里用力拍手,仔细聆听。如果听到颤动声或拖尾回声,说明存在混响问题。

  4. 为了解决这个问题,可以加入能够吸收声音的柔和材料。可以考虑使用地毯、地垫或厚窗帘来显著减少反射。铺盖硬质地面,并在可能的情况下在窗户上挂上窗帘,同时在房间里放置带布艺包覆的家具,都会有所帮助。

  5. 避免使用硬质表面,因为它们会加重这个问题。如果你负担不起专业吸音板,也可以利用画布装饰画、挂毯或泡沫板等日常物品来打散这些表面。

  6. 在设置麦克风时,请留意其摆放位置。避免把它放得离墙面或角落太近。相反,应尽量放在房间中央,或尝试不同位置,找到混响最少的最佳点。

耳机串音

在录音时,尤其是录制歌声时,耳机中的音频串入麦克风是很常见的。这个问题通常出现在耳机音量过高,或者使用开放式耳机时。录歌时这或许可以接受,但在录制你的歌手模型时,请尽量避免这种串音。

麦克风摆位

在正常音量下,建议你距离麦克风大约 2 英寸。若是更响亮的乐句,或需要强声演唱时,建议将距离增至约 4-6 英寸。需要注意的是,为了保持最佳收音效果,你应始终保持在距离麦克风 12 英寸以内。

为强声演唱留出空间

进行强声演唱技巧时,必须在麦克风距离和所在房间大小上给自己留出足够空间。过度隔音,例如被限制在衣柜或录音亭中,或者用泡棉把麦克风四周包起来,都很容易导致麦克风振膜过载。如果你不确定,建议在演唱强声乐句时加入更多房间声。

演唱语言

基础自定义槽位

在基础自定义槽位下训练的你的歌手模型只支持一种演唱语言。

专业自定义槽位

在专业自定义槽位下训练的你的歌手可以支持多语种。

素材中的语言

在训练过程中,每个素材文件都会被单独处理,并视为单语言文件。务必避免在同一个素材文件中混入不同语言的短语。

上传素材时,请务必将其放在对应的语言标签下。即使你上传的是基础自定义槽位素材,如有需要,你也可以灵活上传不同语言的素材。按语言整理素材有助于保持清晰,并提升训练过程。

即将支持的语言

我们正在持续开发新的演唱语言,以支持自定义歌手功能。

对于你的新歌手:

  • 新的专业自定义槽位将支持新语言。

  • 新的基础自定义槽位将提供一种可选的新语言支持。

对于你现有的歌手:

  • 重新训练你的专业自定义槽位时,将支持新语言。

  • 重新训练你的基础自定义槽位时,新语言将作为可选项。

演唱或语音

演唱素材和说话素材都可以用于训练你的歌声模型。

你的歌手可以学习:

  • 从你的演唱素材和说话素材中学习音色,但请注意:对一个人来说,说话的音色可能与演唱不同,而说话通常无法代表演唱的真实表现。

  • 从你的演唱素材中学习演唱风格

你的歌手无法学习:

  • 从你的说话素材中学习演唱风格

文件质量设置

你的素材音频质量会直接影响歌手的质量。

我们建议将音频质量设置为:

  • 位深 = 16 位

  • 采样率 = 44.1 kHz 或 48 kHz

  • 无损格式(.wav 或 .flac)

后期处理

为了保持目标歌手的自然特征和清晰度:

  • 不要重叠: 多层歌声会让 AI 的分析复杂化。请将重叠的录音段放在后面,并保持单一歌声轨道,以确保 AI 能准确处理并从你的素材中学习。

  • 不要硬切: 硬切会造成突兀的开头或结束,这在自然演唱中并不常见,还可能带来咔哒声或爆音。请在人声片段的开头和结束使用平滑淡入淡出,以获得更自然的过渡。

  • 不要重复段落: 重复段落对训练没有帮助。你的歌手模型更能从演唱的自然变化中受益。

  • 控制音量: 确保你的素材音量大致保持在表头的 30-50%。使用音量推子或自动化来保证整个数据集的音量水平一致。目标是在保持段落内动态变化的同时,让整段录音的音量保持统一。

训练你的歌手

准备好数据集后,你可以前往 自定义歌手页面 选择一个自定义槽位,上传你的歌声素材,并开始训练。

一个基础自定义槽位会为你带来一个单语种歌手,共 5 个版本。

一个专业自定义槽位会为你带来一个多语种歌手,共 5 个版本。

点击一个槽位即可开始上传你的素材。

所有素材上传完成后,训练会自动开始。你可以通过刷新网页查看状态。

当你看到训练页面切换为声音克隆管理页时,你的歌手就已经设置完成。它会显示在 ACE Studio 的歌手库中。如果看不到,请尝试重新启动 ACE Studio。

专业提示

如果你希望某个歌手拥有独特的表现力和角色感,例如在不同音域或情绪下都达到最佳效果,最好将素材拆分给多个歌手。

例如:

Mike 是一位专业歌手,想要定制自己的歌手。他既能胜任高音,也能胜任贝斯。因此,最好训练 2 个歌手:

  • 基于大多为高音且有力量表现的素材,训练一个高音且有力量的歌手。

  • 基于大多为低音段落的素材,训练一个贝斯歌手。

重新训练你的歌手

点击 重新训练 按钮可重新训练你的歌手。

重新训练会移除该槽位下你之前的歌手,并注销与该歌手关联的任何已部署声线。AI 将使用新的数据集从头开始训练一个全新的歌手。在开始重新训练之前,你可以选择保留该槽位中的历史素材并上传额外的新素材,或者清空历史素材,只使用新上传的素材。

准备新素材时,请注意:

  • 如果新加入素材的音符时长明显小于已上传素材,例如在一个 30 分钟的数据集中再添加 1 分钟的新素材,重新训练可能不会给歌手表现带来显著变化。

  • 重新训练不会改变槽位类型。

  • 你可以通过重新训练来切换基础自定义槽位支持的语言。

我什么时候应该重新训练我的歌手?

  • 当你的数据集质量更高或数量更大时,你可以利用它们迭代优化你的歌手。

  • 当你对当前结果不满意,并想调整数据集时

  • 当新的演唱语言能力发布时

管理你的歌手

版本

AI 会从你的数据中逐步学习,并以循序渐进的方式分析每个素材。随着学习加深,步骤数量也会增加。使用小型或质量有限的数据集进行训练,例如并非为演唱而设计、而是用于语音的数据集,可能只需要少量步骤。相较之下,更大且更多样化的数据集,可能需要更多步骤才能充分拟合。不过,过多的训练步骤可能导致过拟合,从而以不可预测的结果降低你的歌手表现。

训练结束后,你会得到基于不同训练步骤的多个版本,从 Rare 到 Well-done。你可以通过切换部署并逐一对比,找出最佳版本。

混合声线

混合声线会生成一个混合歌手。你可以通过调整混合声线的比例,让你的歌手更接近目标歌手。为此,请进入槽位管理页面,点击每个版本下方的“声线混合”按钮。

混合后,你的歌手将采用新的歌手特征。要应用这些更改,你需要通过重新启动 ACE Studio 来刷新你的歌手。

部署到 ACE Studio

对于基础自定义槽位和专业自定义槽位,在部署某个版本后,你可以将部署从一个版本切换到另一个版本。每次部署后,你都需要重新启动 ACE Studio,以刷新你的歌手库。

最后更新于