> For the complete documentation index, see [llms.txt](https://docs.acestudio.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.acestudio.ai/docs/product-wiki-es/clonacion-de-voz/cloning-a-voice-for-vocal-synth.md).

# Clonación de una Voz para Síntesis Vocal

## ¿Qué es la Clonación de voz de Síntesis Vocal? <a href="#block-17608bffde808018b367cbddf8c9fe36" id="block-17608bffde808018b367cbddf8c9fe36"></a>

Esta es una función para personalizar tu propio modelo de síntesis vocal cargando tus muestras vocales. La IA aprenderá el timbre y el estilo de canto a partir de las muestras que cargues y clonará una versión digital de tu voz.

Después de la personalización, podrás usar tu voz para generar voces a partir de MIDI y letras, igual que nuestras voces de IA prediseñadas en ACE Studio.

{% hint style="success" %}
Tu voz de IA clonada es privada en tu cuenta; nadie más puede acceder a ella sin tu autorización.
{% endhint %}

## ¿Cómo clonar mi voz para Síntesis Vocal? <a href="#block-17608bffde8080b98024eb3edc82d4d6" id="block-17608bffde8080b98024eb3edc82d4d6"></a>

### Preparación de tus conjuntos de datos

<details>

<summary>Voces secas limpias</summary>

Las voces de alta calidad requieren muestras vocales limpias y secas:

* Sin efectos de reverberación, retardo ni coro
* Sin ruido de fondo
* Sin instrumentales ni sonidos no humanos
* Sin armonías ni Dobles vocales

Se recomiendan entre 30 y 100 minutos de muestras vocales cantadas para una voz. Cuantas más muestras proporciones, más detalles de canto podrá aprender la IA, pero los beneficios adicionales serán menores al superar los 120 minutos.

> Reflexiones de la sala
>
> Las Voces grabadas con muchas reflexiones de sala pueden provocar reconocimientos erróneos y dar lugar a un rendimiento inesperado del modelo.

> Voces de un Separador de pistas
>
> Al usar un eliminador vocal o un Separador de pistas para voces, la calidad de salida puede deteriorarse demasiado para el entrenamiento. Para obtener un modelo de voz de mayor calidad, utiliza preferiblemente voces de un Separador de pistas.

</details>

<details>

<summary>Grabación de muestras</summary>

**Micrófono de calidad con interfaz de audio**

Los micrófonos profesionales con interfaces de audio proporcionan voces de alta calidad. Necesitarás software de grabación para conectarte a tu interfaz, grabar, editar y mezclar tus voces.

Al grabar para un modelo de voz, evita micrófonos que no estén diseñados para cantar:

* Micrófonos de teléfono o portátil
* Micrófonos de solapa o de diadema
* Micrófonos de karaoke
* Micrófonos de auriculares o auriculares Bluetooth como los AirPods (normalmente se usan para llamadas telefónicas)

**Entorno de grabación**

1. Los ruidos de fondo no deseados pueden incluir conversaciones, zumbidos eléctricos, tráfico y ruido exterior, así como movimientos de accesorios u objetos. Para evitar que estos ruidos interfieran en tu grabación, es importante elegir un lugar silencioso. Escoge un lugar donde puedas minimizar o eliminar perturbaciones sonoras inesperadas.
2. Las reflexiones sonoras pueden producirse por la presencia de superficies duras y planas, generando reverberación o ecos en tus grabaciones. Esto puede dar a tus pistas una cualidad hueca o distante, restando intimidad y claridad.
3. Prueba a dar una palmada seca en la sala y escucha atentamente. Si percibes un sonido vibrante o un eco prolongado, indica la presencia de problemas de reverberación.
4. Para solucionarlo, incorpora materiales suaves que puedan absorber el sonido. Considera usar moquetas, alfombras o cortinas gruesas para reducir significativamente las reflexiones. Cubrir los suelos duros y, si es posible, colgar cortinas sobre las ventanas, así como colocar muebles con revestimientos de tela en la sala, puede ser beneficioso.
5. Evita usar superficies duras, ya que contribuyen al problema. Si no puedes permitirte paneles acústicos profesionales, puedes utilizar objetos cotidianos como pinturas sobre lienzo, tapices o baldosas de espuma para interrumpir estas superficies.
6. Al instalar el micrófono, presta atención a su ubicación. Evita colocarlo demasiado cerca de las paredes o en esquinas. En su lugar, intenta situarlo en el centro de la sala o experimenta con diferentes ubicaciones para encontrar el punto óptimo con la mínima reverberación.

**Filtración de auriculares**

Durante las grabaciones, especialmente al capturar voces, es común que el audio de los auriculares se filtre al micrófono. Este problema surge cuando el volumen de los auriculares está demasiado alto o cuando se utilizan auriculares abiertos. Puede ser aceptable al grabar una canción, pero intenta evitar esta filtración al grabar para tu modelo de voz.

**Ubicación del micrófono**

Para un volumen normal, se recomienda situarte a unas 2 pulgadas del micrófono. Sin embargo, para frases más fuertes o al cantar con belting, se aconseja aumentar la distancia a unas 4-6 pulgadas. Es importante tener en cuenta que siempre debes permanecer a menos de 12 pulgadas del micrófono para mantener una captura de audio óptima.

> Crear espacio para el belting
>
> Al utilizar técnicas de belting, es importante disponer de suficiente espacio, tanto en términos de distancia al micrófono como del tamaño de la sala. Un aislamiento acústico excesivo, como estar confinado en un armario o cabina, o rodear el micrófono con espuma, puede sobrecargar fácilmente la cápsula del micrófono. Si no estás seguro, es aconsejable incorporar más sonido de sala al interpretar frases con belting.

</details>

<details>

<summary>Idiomas de canto</summary>

**Ranura personalizada básica**

Solo se admitirá un idioma de canto en tu modelo de voz entrenado en una ranura personalizada básica.

**Ranura personalizada Pro**

Tu voz entrenada en una ranura personalizada Pro puede ser multilingüe.

**Idiomas de tus muestras**

Durante el proceso de entrenamiento, cada archivo de muestra se procesará individualmente y se tratará como un archivo de un solo idioma. Es importante evitar mezclar frases de distintos idiomas dentro del mismo archivo de muestra.

Al cargar muestras, asegúrate de colocarlas en la pestaña de idioma correspondiente. Incluso si cargas muestras para una ranura personalizada básica, puedes cargar muestras en distintos idiomas si lo necesitas. Mantener las muestras organizadas por idioma ayudará a conservar la claridad y a mejorar el proceso de entrenamiento.

**Próximos idiomas**

Trabajamos continuamente en el desarrollo de nuevos idiomas de canto para la función de voz personalizada.

Para tu nueva voz:

* Los nuevos idiomas serán compatibles con las nuevas ranuras personalizadas Pro.
* Los nuevos idiomas serán una de las opciones compatibles con las nuevas ranuras personalizadas básicas.

Para tu voz existente:

* Los nuevos idiomas serán compatibles al volver a entrenar tus ranuras personalizadas Pro.
* Los nuevos idiomas serán opcionales al volver a entrenar tus ranuras personalizadas básicas.

</details>

<details>

<summary>Canto o habla</summary>

Se aceptan tanto muestras cantadas como muestras de voz hablada para entrenar tu modelo de voz cantante.

Tu voz puede aprender:

* El timbre de tus muestras cantadas y de voz hablada, pero ten en cuenta que, en una persona, el timbre al hablar puede ser distinto al cantar, por lo que normalmente no representa la interpretación real del canto.
* El estilo de canto de tus muestras cantadas

Tu voz no puede aprender:

* El estilo de canto de tus muestras de voz hablada

</details>

<details>

<summary>Configuración de calidad de archivo</summary>

La calidad de audio de tus muestras afecta directamente a la calidad de tu voz.

Te recomendamos configurar la calidad de audio así:

* Profundidad de bits = 16 bits
* Frecuencia de muestreo = 44,1 kHz o 48 kHz
* Formato de archivo sin pérdida (.wav o .flac)

</details>

<details>

<summary>Posprocesamiento</summary>

Para mantener el carácter natural y la claridad de tu voz objetivo:

* **Sin solapamientos:** las voces multicapa pueden complicar el análisis de la IA. Coloca las tomas solapadas al fondo y utiliza una única pista vocal para garantizar que la IA pueda procesar y aprender con precisión de tus muestras.
* **Sin cortes bruscos:** los cortes bruscos pueden crear inicios o finales abruptos, que no son normales en un sonido de canto natural y pueden introducir clics o chasquidos. Usa fundidos suaves al inicio y al final del Clip vocal para lograr una transición más natural.
* **Sin duplicar secciones:** Las secciones duplicadas no ayudan al entrenamiento. Tu modelo de voz se beneficia de la variación natural de la interpretación.
* **Controla el volumen:** Asegúrate de que tus muestras se mantengan alrededor del 30-50 % de tu medidor. Usa un control automático de volumen o Automatización para asegurarte de que los niveles de volumen sean uniformes en todo tu conjunto de datos. El objetivo es crear un nivel de volumen uniforme en toda la grabación, manteniendo la dinámica dentro de las secciones.

</details>

### Entrenamiento de tu Voz

Después de preparar tus conjuntos de datos, puedes ir a <a href="https://acestudio.ai/app/custom-voice/vocal-synth" class="button secondary" data-icon="browser">Página de Voz personalizada</a> para seleccionar una ranura personalizada, cargar tus muestras vocales e iniciar el entrenamiento.

Una ranura personalizada básica te ofrece una voz monolingüe con 5 versiones.

Una ranura personalizada Pro te ofrece una voz multilingüe con 5 versiones.

Haz clic en una ranura para empezar a subir tus muestras.

Una vez cargadas todas las muestras, el entrenamiento comenzará automáticamente. Puedes consultar el estado actualizando la página web.

Cuando veas que la página de entrenamiento se convierte en la página de gestión de clonación de voz, tu voz estará lista. Se mostrará en tu biblioteca de voces de ACE Studio. Si no puedes verla, intenta reiniciar ACE Studio.

{% hint style="info" %}
**Consejos profesionales**

Si buscas una interpretación y un carácter exclusivos para una voz, como los mejores resultados en distintos registros vocales o emociones, sería mejor dividir las muestras para varias voces.

Aquí tienes un ejemplo:

Mike es un cantante profesional y le gustaría personalizar su propia voz. Puede cantar bien tanto de tenor como de bajo. Por lo tanto, sería mejor entrenar 2 voces:

* Entrena una voz aguda y potente a partir de muestras que consistan principalmente en interpretaciones agudas y potentes.
* Entrena una voz de bajo a partir de muestras que consistan principalmente en frases de tono grave.
  {% endhint %}

### Reentrenamiento de tu Voz

Haz clic en el <kbd>Reentrenar</kbd> botón para reentrenar tu voz.

El reentrenamiento eliminará tu voz anterior de esta ranura y retirará cualquier cantante implementado asociado a la voz. La IA comenzará a entrenar una voz completamente nueva desde cero utilizando el nuevo conjunto de datos. Antes de iniciar el proceso de reentrenamiento, puedes conservar las muestras históricas de esta ranura y cargar muestras nuevas adicionales, o borrar las muestras históricas y utilizar únicamente las muestras recién cargadas.

Al preparar muestras nuevas, ten en cuenta lo siguiente:

* Si la duración de las muestras recién añadidas es significativamente menor que la de las muestras ya cargadas, por ejemplo, al añadir 1 min de muestra nueva a un conjunto de datos de 30 min, es posible que el reentrenamiento no genere cambios significativos en el rendimiento de la voz.
* El reentrenamiento no cambiará el tipo de tu ranura.
* Puedes cambiar el idioma compatible de tu ranura personalizada básica mediante el reentrenamiento.

{% hint style="info" %}
**¿Cuándo debería reentrenar mi voz?**

* Cuando tus conjuntos de datos tengan mayor calidad o una mayor cantidad de datos, podrás usarlos para mejorar tu voz de forma iterativa.
* Cuando no estés satisfecho con el resultado actual y quieras ajustar tus conjuntos de datos
* Cuando se publique una nueva capacidad de idioma de canto
  {% endhint %}

### Gestión de tu Voz

<details>

<summary>Versiones</summary>

La IA aprende de forma incremental a partir de tus datos, analizando cada muestra paso a paso. A medida que el aprendizaje se profundiza, aumenta el número de pasos. El entrenamiento con un conjunto de datos pequeño o de calidad limitada, como uno diseñado para voz hablada y no para canto, puede requerir solo unos pocos pasos. En cambio, un conjunto de datos más grande y diverso podría necesitar pasos adicionales para un ajuste exhaustivo. Sin embargo, un número excesivo de pasos de entrenamiento puede provocar sobreajuste y degradar potencialmente el rendimiento de tu voz con resultados impredecibles.

Al finalizar el entrenamiento, obtendrás varias versiones basadas en distintos pasos de entrenamiento, de inicial a muy lograda. Puedes encontrar la mejor versión cambiando la implementación y comparándolas entre sí.

</details>

<details>

<summary>Mezclar Voces</summary>

La mezcla de voces produce una voz híbrida. Puedes personalizar tu voz para que suene más como tu voz objetivo ajustando las proporciones de las voces mezcladas. Para ello, ve a la página de gestión de ranuras y haz clic en el botón «mezclar voces» situado debajo de cada versión.

Después de la mezcla, tu voz adoptará las nuevas características vocales. Para aplicar estos cambios, tendrás que actualizar tu voz reiniciando ACE Studio.

</details>

<details>

<summary>Implementar en ACE Studio</summary>

En las ranuras personalizadas básicas y Pro, después de implementar una versión, puedes cambiar la implementación de una versión a otra. Debes reiniciar ACE Studio después de cada implementación para actualizar tu biblioteca de voces.

</details>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.acestudio.ai/docs/product-wiki-es/clonacion-de-voz/cloning-a-voice-for-vocal-synth.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
