> For the complete documentation index, see [llms.txt](https://docs.acestudio.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.acestudio.ai/docs/product-wiki-es/clonacion-de-voz/cloning-a-voice-for-vocal-synth.md).

# Clonar una voz para Síntesis Vocal

## ¿Qué es la clonación de Síntesis Vocal? <a href="#block-17608bffde808018b367cbddf8c9fe36" id="block-17608bffde808018b367cbddf8c9fe36"></a>

Esta función te permite personalizar tu propio modelo de Síntesis Vocal subiendo tus muestras vocales. La IA aprenderá el timbre y el estilo de canto a partir de las muestras que subas, y clonará una versión digital de tu voz.

Después de la personalización, podrás usar tu voz para generar Voces a partir de MIDI y letras, igual que nuestras voces de IA predefinidas en ACE Studio.

{% hint style="success" %}
Tu Voz de IA clonada es privada dentro de tu cuenta; nadie más puede acceder a ella sin tu autorización.
{% endhint %}

## ¿Cómo clonar mi voz para Síntesis Vocal? <a href="#block-17608bffde8080b98024eb3edc82d4d6" id="block-17608bffde8080b98024eb3edc82d4d6"></a>

### Preparación de tus conjuntos de datos

<details>

<summary>Voces limpias y secas</summary>

Las Voces de alta calidad requieren Muestras vocales limpias y secas:

* Sin reverberación, retardo ni efectos de coro
* Sin ruido de fondo
* Sin instrumentales ni sonidos no humanos
* Sin armonías ni Dobles vocales

Se recomiendan entre 30 y 100 minutos de Muestras vocales cantadas para una Voz. Cuantas más Muestras proporciones, más detalles de canto puede aprender la IA, pero aporta menos beneficios cuando superas los 120 minutos.

> Reflexiones de la sala
>
> Las Voces grabadas con grandes reflexiones de la sala pueden provocar errores de reconocimiento y dar lugar a un rendimiento inesperado del Modelo.

> Voces del Separador de pistas
>
> Cuando uses un eliminador de vocales o el Separador de pistas para Voces, la calidad de salida podría degradarse demasiado para el entrenamiento. Para un Modelo de Voz de mayor calidad, usa opcionalmente Voces del Separador de pistas.

</details>

<details>

<summary>Grabación de Muestras</summary>

**Micrófono de calidad con interfaz de Audio**

Los micrófonos profesionales con interfaces de Audio ofrecen Voces de alta calidad. Necesitarás software de grabación para conectar tu interfaz, grabar, editar y mezclar tus Voces.

Al grabar para un Modelo de Voz, evita los micrófonos que no están diseñados para cantar:

* Micrófonos de teléfono o portátil
* Micrófonos de solapa o de auriculares
* Micrófonos de karaoke
* Micrófonos de auriculares o auriculares Bluetooth como AirPods (normalmente se usan para llamadas telefónicas)

**Entorno de grabación**

1. Los ruidos de fondo no deseados pueden incluir personas hablando, zumbidos eléctricos, tráfico y ruido exterior, así como movimientos de accesorios u objetos. Para evitar que estos ruidos interfieran con tu grabación, es importante elegir un lugar tranquilo. Busca un sitio donde puedas minimizar o eliminar las perturbaciones sonoras inesperadas.
2. Las reflexiones sonoras pueden producirse por la presencia de superficies duras y planas, lo que genera reverberación o ecos en tus grabaciones. Esto puede dar a tus Pistas un carácter hueco o distante, restando intimidad y claridad.
3. Prueba a aplaudir con fuerza en la sala y escucha con atención. Si percibes un sonido de aleteo o un eco prolongado, indica la presencia de problemas de reverberación.
4. Para solucionarlo, incorpora materiales Suaves que absorban el sonido. Considera usar alfombras, tapetes o cortinas gruesas para reducir notablemente las reflexiones. Cubrir los suelos duros y, si es posible, colgar cortinas sobre las ventanas, así como colocar muebles con fundas de tela en la sala, puede ser beneficioso.
5. Evita usar superficies duras, ya que contribuyen al problema. Si no puedes permitirte paneles acústicos profesionales, puedes usar elementos cotidianos como cuadros sobre Lienzo, tapices o paneles de espuma para romper estas superficies.
6. Al configurar tu micrófono, presta atención a su colocación. Evita situarlo demasiado cerca de las paredes o en las esquinas. En su lugar, apúntalo hacia el centro de la sala o experimenta con distintas ubicaciones para encontrar el punto óptimo con una reverberación mínima.

**Fuga de auriculares**

Durante las grabaciones, especialmente al capturar Voces, es común que el Audio de los auriculares se filtre en el micrófono. Este problema surge cuando el volumen de los auriculares está demasiado alto o cuando se usan auriculares de respaldo abierto. Esto puede ser aceptable al grabar una canción, pero procura evitar esta fuga al grabar para tu Modelo de Voz.

**Colocación del micrófono**

Para un volumen normal, se recomienda colocarte a unas 2 pulgadas del micrófono. Sin embargo, para frases más fuertes o al proyectar con potencia, conviene aumentar la distancia a unas 4-6 pulgadas. Es importante señalar que siempre debes permanecer a menos de 12 pulgadas del micrófono para mantener una captura de Audio óptima.

> Crear espacio para el canto potente
>
> Cuando uses técnicas de canto potente, es importante darte suficiente espacio, tanto en la distancia al micrófono como en el tamaño de la sala en la que te encuentres. Un aislamiento excesivo del sonido, como quedar encerrado en un armario o cabina, o rodear el micrófono con espuma, puede provocar fácilmente una sobrecarga de la cápsula del micrófono. Si no estás seguro, conviene incorporar más sonido de sala al interpretar frases potentes.

</details>

<details>

<summary>Idiomas de canto</summary>

**Slot personalizado básico**

Solo se admitirá un idioma de canto en tu modelo de voz entrenado en un slot personalizado básico.

**Slot personalizado Pro**

Tu voz entrenada en un slot personalizado Pro puede ser multilingüe.

**Idiomas en tus muestras**

Durante el proceso de entrenamiento, cada archivo de muestra se procesará individualmente y se tratará como un archivo de un solo idioma. Es importante evitar mezclar frases de distintos idiomas dentro del mismo archivo de muestra.

Cuando subas muestras, asegúrate de colocarlas en la pestaña de idioma correspondiente. Incluso si estás subiendo muestras para un slot personalizado básico, tienes la flexibilidad de subir muestras en distintos idiomas si es necesario. Mantener las muestras organizadas por idioma ayudará a conservar la claridad y mejorar el proceso de entrenamiento.

**Próximos idiomas**

Estamos trabajando continuamente en el desarrollo de nuevos idiomas de canto para la función de voz personalizada.

Para tu nueva voz:

* Los nuevos idiomas serán compatibles con los nuevos slots personalizados Pro.
* Los nuevos idiomas serán una de las opciones compatibles con los nuevos slots personalizados básicos.

Para tu voz existente:

* Los nuevos idiomas serán compatibles al reentrenar tus slots personalizados Pro.
* Los nuevos idiomas serán opcionales al reentrenar tus slots personalizados básicos.

</details>

<details>

<summary>Canto o discurso</summary>

Se pueden aceptar tanto muestras de canto como muestras de voz hablada para entrenar tu modelo de voz para canto.

Tu voz puede aprender:

* Timbre de tus muestras de canto y de voz hablada, pero ten en cuenta: en una persona, el timbre al hablar puede ser diferente al timbre al cantar, por lo general no representa la verdadera interpretación al cantar.
* Estilo de canto de tus muestras de canto

Tu voz no puede aprender:

* Estilo de canto de tus muestras de voz hablada

</details>

<details>

<summary>Configuración de calidad de archivos</summary>

La calidad de Audio de tus Muestras impacta directamente en la calidad de tu Voz.

Te recomendamos configurar tu calidad de Audio en:

* Profundidad de bits = 16 bits
* Frecuencia de muestreo = 44.1 kHz o 48 kHz
* Formato de archivo sin pérdida (.wav o .flac)

</details>

<details>

<summary>Posprocesado</summary>

Para mantener el carácter natural y la claridad de tu Voz objetivo:

* **Sin solapamientos:** las Voces multicapa pueden complicar el análisis de la IA. Coloca las tomas solapadas al fondo y mantén una sola Pista vocal para asegurarte de que la IA pueda procesar y aprender con precisión de tus Muestras.
* **Sin cortes bruscos:** los cortes bruscos pueden crear inicios o finales repentinos, que no son normales en un sonido de canto natural, y pueden introducir clics o pops. Usa fundidos suaves al principio y al final del Clip vocal para lograr una transición más natural.
* **Sin secciones duplicadas:** Las secciones duplicadas no ayudan al entrenamiento. Tu Modelo de Voz se beneficia de la variación natural de la interpretación.
* **Controla el volumen:** Asegúrate de que tus Muestras se mantengan alrededor del 30-50% de tu medidor. Usa un control de volumen o Automatización para asegurarte de que los niveles de volumen sean consistentes en todo tu conjunto de datos. El objetivo es crear un nivel de volumen uniforme en toda la grabación, manteniendo la dinámica dentro de las secciones.

</details>

### Entrenamiento de tu Voz

Después de preparar tus conjuntos de datos, puedes ir a <a href="https://acestudio.ai/app/custom-voice/vocal-synth" class="button secondary" data-icon="browser">Página de Voz personalizada</a> para seleccionar un slot personalizado, sube tus muestras vocales e inicia el entrenamiento.

Un slot personalizado básico te ofrece una voz monolingüe con 5 versiones.

Un slot personalizado Pro te ofrece una voz multilingüe con 5 versiones.

Haz clic en una ranura para empezar a cargar tus Muestras.

Una vez que se hayan subido todas las muestras, el entrenamiento comenzará automáticamente. Puedes comprobar el estado al actualizar la página web.

Cuando veas que la página de entrenamiento se convierte en la página de gestión de clonación de voz, tu voz estará lista. Se mostrará en tu biblioteca de voces en ACE Studio. Si no la ves, intenta reiniciar ACE Studio.

{% hint style="info" %}
**Consejos profesionales**

Si buscas una interpretación y un carácter exclusivos para una voz, como obtener los mejores resultados en distintos rangos vocales o emociones, sería mejor dividir las muestras entre varias voces.

Aquí tienes un ejemplo:

Mike es un cantante profesional y quiere personalizar su propia voz. Puede rendir bien tanto como tenor como en bajo. Así que sería mejor entrenar 2 voces:

* Entrena una voz aguda y potente basada en muestras que sean mayoritariamente interpretaciones agudas y potentes.
* Entrena una voz grave basada en muestras que sean mayoritariamente frases graves.
  {% endhint %}

### Reentrenamiento de tu Voz

Haz clic en el <kbd>Reentrenar</kbd> botón para reentrenar tu Voz.

El reentrenamiento eliminará tu voz anterior en este slot y retirará cualquier cantante desplegado asociado a la voz. La IA comenzará a entrenar una voz completamente nueva desde cero usando el nuevo conjunto de datos. Antes de iniciar el proceso de reentrenamiento, puedes optar por conservar las muestras históricas dentro de este slot y subir nuevas muestras adicionales, o puedes elegir borrar las muestras históricas y usar solo las muestras recién subidas.

Al preparar nuevas Muestras, ten en cuenta:

* Si la duración de las muestras recién añadidas es significativamente menor que la de las muestras ya subidas, por ejemplo, añadir 1 min de muestra nueva a un conjunto de datos de 30 mins, el reentrenamiento puede no producir cambios significativos en el desempeño de la voz.
* El reentrenamiento no cambiará el tipo de tu ranura.
* Puedes cambiar el idioma compatible de tu slot personalizado básico mediante el reentrenamiento.

{% hint style="info" %}
**¿Cuándo debo reentrenar mi Voz?**

* Cuando tus conjuntos de datos tengan mejor calidad o una mayor cantidad, puedes usarlos para mejorar tu voz de forma iterativa
* Cuando no estés satisfecho con el resultado actual y quieras ajustar tus conjuntos de datos
* Cuando se lance una nueva capacidad de idioma de canto
  {% endhint %}

### Gestionar tu Voz

<details>

<summary>Versiones</summary>

La IA aprende de forma incremental a partir de tus datos, analizando cada muestra en un proceso paso a paso. A medida que el aprendizaje se profundiza, aumenta el número de pasos. Entrenar con un conjunto de datos pequeño o de calidad limitada, por ejemplo uno no diseñado para canto sino para habla, puede requerir solo unos pocos pasos. En cambio, un conjunto de datos más grande y diverso puede necesitar pasos adicionales para un ajuste completo. Sin embargo, un número excesivo de pasos de entrenamiento puede provocar sobreajuste, degradando potencialmente el rendimiento de tu voz con resultados impredecibles.

Al final del entrenamiento, obtendrás varias versiones basadas en distintos pasos de entrenamiento, desde Rare hasta Well-done. Puedes encontrar la mejor versión cambiando el despliegue y comparándolas entre sí.

</details>

<details>

<summary>Mezclar Voces</summary>

La mezcla de voces da como resultado una voz híbrida. Puedes personalizar tu voz para que se parezca más a tu voz objetivo ajustando las proporciones de las voces mezcladas. Para hacerlo, ve a la página de gestión de slots y haz clic en el botón ‘Mezclar Voces’ situado debajo de cada versión.

Después de la mezcla, tu voz adoptará las nuevas características de voz. Para aplicar estos cambios, deberás actualizar tu voz reiniciando ACE Studio.

</details>

<details>

<summary>Desplegar en ACE Studio</summary>

Para los slots personalizados básicos y Pro, después de desplegar una versión, puedes cambiar el despliegue de una versión a otra. Debes volver a iniciar ACE Studio después de cada despliegue para actualizar tu biblioteca de voces.

</details>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.acestudio.ai/docs/product-wiki-es/clonacion-de-voz/cloning-a-voice-for-vocal-synth.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
