> For the complete documentation index, see [llms.txt](https://docs.acestudio.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.acestudio.ai/docs/product-wiki-ko/voice-cloning/cloning-a-voice-for-vocal-synth.md).

# 보컬 신스용 음성 복제

ACE Studio에서 자신의 음성을 보컬 신스 음성으로 복제합니다.

## 보컬 신스 복제란 무엇인가요? <a href="#block-17608bffde808018b367cbddf8c9fe36" id="block-17608bffde808018b367cbddf8c9fe36"></a>

이 기능을 사용하면 보컬 샘플을 업로드하여 나만의 보컬 신스 모델을 사용자 지정할 수 있습니다. AI는 업로드한 샘플을 바탕으로 음색과 노래 스타일을 학습하고, 음성의 디지털 버전을 복제합니다.

사용자 지정 후에는 ACE Studio의 사전 제작된 AI 음성처럼 MIDI와 가사를 사용해 자신의 음성으로 보컬을 생성할 수 있습니다.

{% hint style="success" %}
클론된 AI 음성은 계정 내에서 비공개로 유지되며, 사용자의 승인 없이는 다른 사람이 접근할 수 없습니다.
{% endhint %}

## 보컬 신스용 내 음성을 복제하는 방법? <a href="#block-17608bffde8080b98024eb3edc82d4d6" id="block-17608bffde8080b98024eb3edc82d4d6"></a>

### 데이터셋 준비하기

<details>

<summary>깨끗한 드라이 보컬</summary>

고품질 음성을 위해서는 깨끗하고 건조한 보컬 샘플이 필요합니다:

* 리버브, 딜레이, 코러스 효과 없이
* 배경 소음 없이
* 반주나 비인간적인 소리 없이
* 화음이나 더블스 없이

한 음성당 30\~100분의 노래 보컬 샘플을 권장합니다. 제공하는 샘플이 많을수록 AI가 더 많은 노래 디테일을 학습할 수 있지만, 120분을 넘으면 추가 이점은 줄어듭니다.

> 룸 리플렉션
>
> 큰 공간 반사가 있는 환경에서 녹음된 보컬은 오류 인식을 유발하고 모델 성능이 예상과 다르게 나타날 수 있습니다.

> 스템 분리기에서 추출한 보컬
>
> 보컬 리무버나 스템 분리기를 사용해 보컬을 추출할 경우, 출력 품질이 학습에 너무 낮게 손상될 수 있습니다. 더 높은 품질의 음성 모델을 원한다면, 선택적으로 스템 분리기에서 추출한 보컬을 사용하세요.

</details>

<details>

<summary>녹음 샘플</summary>

**오디오 인터페이스가 있는 고품질 마이크**

오디오 인터페이스를 갖춘 전문 마이크는 고품질 보컬을 제공합니다. 인터페이스에 연결하고, 보컬을 녹음, 편집, 믹싱하려면 녹음 소프트웨어가 필요합니다.

음성 모델을 위해 녹음할 때는, 노래용으로 설계되지 않은 마이크는 피하세요:

* 휴대폰 또는 노트북 마이크
* 라펠 마이크 또는 헤드셋 마이크
* 노래방 마이크
* 이어폰 마이크 또는 에어팟과 같은 블루투스 이어폰(이들은 보통 통화용입니다)

**녹음 환경**

1. 원치 않는 배경 소음에는 사람들의 대화 소리, 전기적 험과 버즈음, 교통 및 야외 소음, 액세서리나 물체의 움직임이 포함될 수 있습니다. 이러한 소음이 녹음에 간섭하지 않도록 조용한 장소를 선택하는 것이 중요합니다. 예상치 못한 소음 방해를 최소화하거나 없앨 수 있는 곳을 선택하세요.
2. 딱딱하고 평평한 표면이 있으면 소리 반사가 발생해, 녹음에 리버브나 에코가 생길 수 있습니다. 이로 인해 트랙이 텅 비거나 멀게 들려 원하는 친밀감과 명료함이 떨어질 수 있습니다.
3. 방 안에서 손뼉을 강하게 쳐 보고 주의 깊게 들어보세요. 떨리는 소리나 긴 잔향이 들린다면 리버브 문제가 있다는 뜻입니다.
4. 이를 해결하려면 소리를 흡수할 수 있는 부드러운 소재를 활용하세요. 카펫, 러그, 두꺼운 커튼을 사용하면 반사를 크게 줄일 수 있습니다. 딱딱한 바닥을 덮고, 가능하다면 창문에 커튼을 걸며, 천 소재로 덮인 가구를 방 안에 배치하는 것도 도움이 됩니다.
5. 딱딱한 표면은 문제를 키우므로 피하세요. 전문 흡음 패널을 구입할 여유가 없다면, 캔버스 그림, 태피스트리, 폼 타일 같은 일상용품으로 이런 표면을 분산시킬 수 있습니다.
6. 마이크를 설치할 때는 위치에 주의하세요. 벽에 너무 가깝게 두거나 구석에 배치하지 마세요. 대신 방의 중앙을 목표로 하거나 여러 위치를 시험해 리버브가 가장 적은 최적의 지점을 찾아보세요.

**헤드폰 블리드**

녹음 중, 특히 보컬을 녹음할 때 헤드폰 소리가 마이크로 새어 들어가는 경우가 흔합니다. 이는 헤드폰 볼륨이 너무 높게 설정되었거나 오픈백 헤드폰을 사용할 때 발생합니다. 곡 녹음에서는 괜찮을 수 있지만, 음성 모델용으로 녹음할 때는 이런 블리드를 피하세요.

**마이크 위치**

일반적인 볼륨에서는 마이크에서 약 2인치 떨어진 위치에 서는 것이 좋습니다. 하지만 더 큰 소리의 구절이나 벨팅에서는 거리를 약 4\~6인치로 늘리는 것이 바람직합니다. 최적의 오디오 캡처를 위해 항상 마이크에서 12인치보다 가까이 있어야 한다는 점을 기억하세요.

> 벨팅을 위한 공간 만들기
>
> 벨팅 테크닉을 사용할 때는 마이크와의 거리뿐 아니라 있는 공간의 크기까지, 충분한 여유를 두는 것이 중요합니다. 옷장이나 부스처럼 지나치게 밀폐된 공간, 또는 마이크를 폼으로 둘러싼 환경은 마이크 캡슐에 과부하를 일으키기 쉽습니다. 확신이 없다면, 벨팅 구절을 녹음할 때는 더 많은 공간음을 담는 편이 좋습니다.

</details>

<details>

<summary>노래 언어</summary>

**기본 사용자 지정 슬롯**

기본 사용자 지정 슬롯에서 학습한 음성 모델은 하나의 노래 언어만 지원합니다.

**프로 사용자 지정 슬롯**

프로 사용자 지정 슬롯에서 학습한 음성은 다국어를 지원할 수 있습니다.

**샘플의 언어**

학습 과정에서 각 샘플 파일은 개별적으로 처리되며 단일 언어 파일로 취급됩니다. 하나의 샘플 파일 안에 서로 다른 언어의 구절을 섞지 않는 것이 중요합니다.

샘플을 업로드할 때는 반드시 적절한 언어 탭 아래에 배치해 주세요. 기본 사용자 지정 슬롯용 샘플을 업로드하더라도, 필요하다면 서로 다른 언어의 샘플을 유연하게 업로드할 수 있습니다. 샘플을 언어별로 정리해 두면 명확성을 유지하고 학습 과정을 개선하는 데 도움이 됩니다.

**추후 지원 언어**

저희는 사용자 지정 음성 기능을 위한 새로운 노래 언어를 지속적으로 개발하고 있습니다.

새 음성의 경우:

* 새로운 언어는 새로운 프로 사용자 지정 슬롯에서 지원됩니다.
* 새로운 언어는 새로운 기본 사용자 지정 슬롯에서 지원되는 옵션 중 하나가 됩니다.

기존 음성의 경우:

* 프로 사용자 지정 슬롯을 재학습하면 새로운 언어가 지원됩니다.
* 기본 사용자 지정 슬롯을 재학습할 때 새로운 언어는 선택 사항입니다.

</details>

<details>

<summary>노래 또는 말하기</summary>

노래 샘플과 음성 샘플 모두 노래 음성 모델 학습에 사용할 수 있습니다.

당신의 음성이 학습할 수 있는 내용:

* 노래 샘플과 음성 샘플의 음색. 단, 유의하세요: 사람의 경우 말할 때의 음색과 노래할 때의 음색은 다를 수 있으며, 일반적으로 이는 실제 노래 퍼포먼스를 온전히 대표하지 못합니다.
* 노래 샘플로부터 노래 스타일

당신의 음성이 학습할 수 없는 내용:

* 음성 샘플로부터 노래 스타일

</details>

<details>

<summary>파일 품질 설정</summary>

샘플의 오디오 품질은 음성의 품질에 직접적인 영향을 줍니다.

오디오 품질은 다음으로 설정하는 것을 권장합니다:

* 비트 깊이 = 16비트
* 샘플레이트 = 44.1khz 또는 48khz
* 무손실 파일 형식(.wav 또는 .flac)

</details>

<details>

<summary>후처리</summary>

목표 음성의 자연스러운 특징과 명료함을 유지하려면:

* **겹침 없음:** 다층 보컬은 AI 분석을 복잡하게 만들 수 있습니다. 겹치는 테이크는 뒤로 배치하고, AI가 샘플을 정확하게 처리하고 학습할 수 있도록 단일 보컬 트랙만 사용하세요.
* **하드 컷 금지:** 하드 컷은 갑작스러운 시작이나 끝을 만들어 자연스러운 노래 소리와 어긋나며, 클릭이나 팝 노이즈를 유발할 수 있습니다. 더 자연스러운 전환을 위해 보컬 클립의 시작과 끝에 부드러운 페이드를 사용하세요.
* **구간 복제 금지:** 복제된 구간은 학습에 도움이 되지 않습니다. 음성 모델은 실제 퍼포먼스의 자연스러운 변화를 통해 더 잘 향상됩니다.
* **볼륨 조절:** 샘플 레벨이 미터의 약 30\~50%를 유지하도록 하세요. 볼륨 라이더나 자동화를 사용해 전체 데이터셋의 볼륨 레벨이 일정하게 유지되도록 하세요. 목표는 녹음 전반의 볼륨 레벨을 일관되게 유지하면서 구간 내 다이내믹스는 살리는 것입니다.

</details>

### 음성 학습하기

데이터셋 준비가 끝나면 다음으로 이동하세요 <a href="https://acestudio.ai/app/custom-voice/vocal-synth" class="button secondary" data-icon="browser">커스텀 음성 페이지</a> 사용자 지정 슬롯을 선택하고, 보컬 샘플을 업로드한 다음, 학습을 시작합니다.

기본 사용자 지정 슬롯은 5개 버전의 단일 언어 음성을 제공합니다.

프로 사용자 지정 슬롯은 5개 버전의 다국어 음성을 제공합니다.

슬롯을 클릭해 샘플 업로드를 시작하세요.

모든 샘플 업로드가 완료되면 학습이 자동으로 시작됩니다. 웹페이지를 새로고침하여 상태를 확인할 수 있습니다.

학습 페이지가 음성 복제 관리 페이지로 바뀌면 음성이 모두 설정된 것입니다. ACE Studio의 음성 라이브러리에 표시됩니다. 보이지 않으면 ACE Studio를 다시 실행해 보세요.

{% hint style="info" %}
**전문가 팁**

음성에 고유한 퍼포먼스와 개성을 원한다면, 예를 들어 서로 다른 음역대나 감정에서 최상의 결과를 얻고자 한다면 샘플을 여러 음성으로 나누는 것이 좋습니다.

예를 들어 보겠습니다:

Mike는 전문 가수이며 자신의 음성을 사용자 지정하고 싶어 합니다. 그는 테너와 베이스 모두 잘 소화합니다. 따라서 2개의 음성을 학습하는 것이 더 좋습니다:

* 대부분 고음역이고 강한 퍼포먼스의 샘플을 바탕으로 고음역 & 파워풀한 음성을 학습합니다.
* 대부분 저음 구절의 샘플을 바탕으로 베이스 음성을 학습합니다.
  {% endhint %}

### 음성 재학습하기

다음을 클릭하세요: <kbd>재학습</kbd> 버튼을 눌러 음성을 재학습하세요.

재학습하면 이 슬롯의 이전 음성이 제거되고 해당 음성과 연결된 배포된 싱어도 내립니다. AI는 새로운 데이터셋을 사용해 완전히 새로운 음성을 처음부터 학습하기 시작합니다. 재학습을 시작하기 전에, 이 슬롯의 기존 샘플을 유지한 채 새 샘플을 추가로 업로드하거나, 기존 샘플을 삭제하고 새로 업로드한 샘플만 사용하는 것을 선택할 수 있습니다.

새 샘플을 준비할 때는 다음 사항을 참고하세요:

* 새로 추가한 샘플의 지속시간이 이미 업로드된 샘플보다 현저히 짧다면, 예를 들어 30분 데이터셋에 1분의 새 샘플을 추가하는 경우, 재학습으로 음성의 퍼포먼스에 큰 변화가 생기지 않을 수 있습니다.
* 재학습은 슬롯 유형을 변경하지 않습니다.
* 재학습을 통해 기본 사용자 지정 슬롯의 지원 언어를 변경할 수 있습니다.

{% hint style="info" %}
**언제 음성을 재학습해야 하나요?**

* 데이터셋의 품질이 더 좋거나 양이 더 많아지면, 이를 사용해 음성을 반복적으로 개선할 수 있습니다.
* 현재 결과가 만족스럽지 않고 데이터셋을 조정하고 싶을 때
* 새로운 노래 언어 기능이 출시될 때
  {% endhint %}

### 음성 관리

<details>

<summary>버전</summary>

AI는 데이터에서 점진적으로 학습하며, 각 샘플을 단계별 과정으로 분석합니다. 학습이 깊어질수록 단계 수가 늘어납니다. 노래용이 아니라 음성용으로 설계된 것처럼 품질이 낮거나 제한적인 데이터셋으로 학습할 경우, 몇 단계만 필요할 수 있습니다. 반대로 더 크고 다양한 데이터셋은 충분한 적합을 위해 추가 단계가 필요할 수 있습니다. 하지만 학습 단계를 과도하게 늘리면 오버피팅이 발생해 예측할 수 없는 결과와 함께 음성의 퍼포먼스가 저하될 수 있습니다.

학습이 끝나면 Rare부터 Well-done까지 서로 다른 학습 단계에 기반한 여러 버전을 얻게 됩니다. 배포를 전환하며 서로 비교하면 가장 적합한 버전을 찾을 수 있습니다.

</details>

<details>

<summary>음성 혼합</summary>

음성 혼합은 하이브리드 음성을 만듭니다. 혼합된 음성의 비율을 조정하여 목표 음성에 더 가깝게 들리도록 사용자 지정할 수 있습니다. 이를 위해 슬롯 관리 페이지로 이동한 다음 각 버전 아래에 있는 ‘음성 혼합’ 버튼을 클릭하세요.

혼합 후에는 음성이 새로운 음성 특성을 갖게 됩니다. 이 변경 사항을 적용하려면 ACE Studio를 다시 시작하여 음성을 새로 고쳐야 합니다.

</details>

<details>

<summary>ACE Studio에 배포</summary>

기본 사용자 지정 슬롯과 프로 사용자 지정 슬롯의 경우, 버전을 배포한 후 다른 버전으로 배포를 전환할 수 있습니다. 음성 라이브러리를 새로 고치려면 각 배포 후 ACE Studio를 다시 실행해야 합니다.

</details>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.acestudio.ai/docs/product-wiki-ko/voice-cloning/cloning-a-voice-for-vocal-synth.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
