For the complete documentation index, see llms.txt. This page is also available as Markdown.

Clonación de una Voz para Síntesis Vocal

Clona tu propia Voz como una Voz de Síntesis Vocal en ACE Studio.

¿Qué es la Clonación de voz de Síntesis Vocal?

Esta es una función para personalizar tu propio modelo de sintetizador vocal subiendo tus Muestras vocales. La IA aprenderá el Timbre y el estilo de canto a partir de las Muestras que subas, y clonará una versión digital de tu Voz.

Después de la personalización, puedes usar tu Voz para generar Voces a partir de MIDI y Letras, igual que con nuestras Voces de IA prediseñadas en ACE Studio.

¿Cómo clonar mi Voz para Síntesis Vocal?

Preparando tus conjuntos de datos

Voces secas y limpias

Las Voces de alta calidad requieren Muestras vocales limpias y secas:

  • Sin efectos de reverb, delay ni chorus

  • Sin ruido de fondo

  • Sin instrumentales ni ningún sonido no humano

  • Sin ninguna armonía ni Dobles vocales

Se recomiendan de 30 a 100 min de Muestras vocales cantadas para una Voz. Cuantas más Muestras proporciones, más detalles de canto podrá aprender la IA, pero los beneficios serán menores cuando superes los 120 minutos.

Reflexiones de sala

Las Voces grabadas con fuertes reflexiones de sala pueden provocar errores de reconocimiento y dar lugar a un comportamiento inesperado del Modelo.

Voces del Separador de pistas

Cuando uses un eliminador de voces o Separador de pistas para Voces, la calidad de salida podría degradarse demasiado para el entrenamiento. Para obtener un Modelo de Voz de mayor calidad, utiliza opcionalmente Voces del Separador de pistas.

Grabando Muestras

Micrófono de calidad con interfaz de Audio

Los micrófonos profesionales con interfaces de Audio ofrecen Voces de alta calidad. Necesitarás software de grabación para conectar tu interfaz, grabar, editar y mezclar tus Voces.

Cuando grabes para un Modelo de Voz, evita micrófonos que no estén pensados para cantar:

  • Micrófonos de teléfono o portátil

  • Micrófonos de solapa o de diadema

  • Micrófonos de karaoke

  • Micrófonos de auriculares o auriculares Bluetooth como AirPods (normalmente se usan para llamadas telefónicas)

Entorno de grabación

  1. Los ruidos de fondo no deseados pueden incluir personas hablando, zumbidos y pitidos eléctricos, tráfico y ruido exterior, así como movimientos de accesorios u objetos. Para evitar que estos ruidos interfieran con tu grabación, es importante elegir un lugar tranquilo. Elige un espacio en el que puedas minimizar o eliminar las perturbaciones sonoras inesperadas.

  2. Las reflexiones del sonido pueden producirse por la presencia de superficies duras y planas, lo que genera reverberación o ecos en tus grabaciones. Esto puede dar a tus Pistas una cualidad hueca o distante, restando intimidad y claridad al resultado deseado.

  3. Prueba a dar una palmada seca en la habitación y escucha con atención. Si percibes un sonido vibrante o un eco prolongado, indica que hay problemas de reverb.

  4. Para solucionarlo, incorpora materiales de tipo Suave que absorban el sonido. Considera usar alfombras, tapetes o cortinas gruesas para reducir significativamente las reflexiones. Cubrir los suelos duros y, si es posible, colgar cortinas en las ventanas, así como colocar muebles tapizados en la habitación, puede ser beneficioso.

  5. Evita usar superficies duras, ya que contribuyen al problema. Si no puedes permitirte paneles acústicos profesionales, puedes utilizar objetos cotidianos como Lienzos pintados, tapices o paneles de espuma para romper esas superficies.

  6. Al configurar tu micrófono, presta atención a su ubicación. Evita colocarlo demasiado cerca de las paredes o en esquinas. En su lugar, apunta al centro de la habitación o prueba distintas ubicaciones para encontrar el punto óptimo con la mínima reverb.

Filtración de auriculares

Durante las grabaciones, especialmente al capturar Voces, es común que el Audio de los auriculares se filtre en el micrófono. Este problema surge cuando el volumen de los auriculares está demasiado alto o cuando se usan auriculares abiertos. Esto puede ser aceptable al grabar una canción, pero procura evitar esa filtración al grabar para tu Modelo de Voz.

Colocación del micrófono

Para un volumen normal, se recomienda situarte a unas 2 pulgadas del micrófono. Sin embargo, para frases más fuertes o al cantar con potencia, es aconsejable aumentar la distancia a unas 4-6 pulgadas. Es importante señalar que siempre debes mantenerte a menos de 12 pulgadas del micrófono para conservar una captura de Audio óptima.

Crear espacio para cantar con potencia

Al emplear técnicas de canto potente, es importante darte suficiente espacio, tanto en la distancia al micrófono como en el tamaño de la sala en la que estás. Un aislamiento acústico excesivo, como estar encerrado en un armario o cabina, o rodear el micrófono con espuma, puede saturar fácilmente la cápsula del micrófono. Si no estás seguro, conviene incorporar más sonido de sala al interpretar frases potentes.

Idiomas de canto

Slot personalizado básico

Solo se admitirá un idioma de canto en tu Modelo de Voz entrenado en un slot personalizado básico.

Slot personalizado Pro

Tu Voz entrenada en un slot personalizado Pro puede ser multilingüe.

Idiomas en tus Muestras

Durante el proceso de entrenamiento, cada archivo de muestra se procesará individualmente y se tratará como un archivo de un solo idioma. Es importante evitar mezclar frases de diferentes idiomas dentro del mismo archivo de muestra.

Al subir Muestras, asegúrate de colocarlas en la pestaña del idioma correspondiente. Incluso si subes Muestras para un slot personalizado básico, tienes la flexibilidad de subir Muestras en distintos idiomas si es necesario. Mantener las Muestras organizadas por idioma ayudará a preservar la claridad y mejorar el proceso de entrenamiento.

Próximos idiomas

Trabajamos continuamente en el desarrollo de nuevos idiomas de canto para la función de Voz personalizada.

Para tu nueva Voz:

  • Los nuevos idiomas serán compatibles con nuevos slots personalizados Pro.

  • Los nuevos idiomas serán una de las opciones compatibles con nuevos slots personalizados básicos.

Para tu Voz existente:

  • Los nuevos idiomas serán compatibles al reentrenar tus slots personalizados Pro.

  • Los nuevos idiomas serán opcionales al reentrenar tus slots personalizados básicos.

Canto o habla

Se pueden aceptar tanto Muestras de canto como Muestras de voz hablada para entrenar tu Modelo de Voz de canto.

Tu Voz puede aprender:

  • El Timbre de tus Muestras de canto y de voz hablada, pero ten en cuenta que, en una persona, el Timbre al hablar puede ser diferente del de cantar, por lo que normalmente no puede representar el rendimiento real del canto.

  • El estilo de canto de tus Muestras de canto

Tu Voz no puede aprender:

  • El estilo de canto de tus Muestras de voz hablada

Configuración de calidad de archivos

La calidad de Audio de tus Muestras impacta directamente en la calidad de tu Voz.

Te recomendamos configurar la calidad de Audio en:

  • Profundidad de bits = 16 bits

  • Frecuencia de muestreo = 44,1 kHz o 48 kHz

  • Formato de archivo sin pérdida (.wav o .flac)

Postprocesado

Para mantener el carácter natural y la claridad de tu Voz objetivo:

  • Sin solapamientos: las Voces multicapa pueden complicar el análisis de la IA. Coloca las tomas solapadas al fondo y limítate a una sola Pista vocal para garantizar que la IA pueda procesar y aprender con precisión de tus Muestras.

  • Sin cortes bruscos: los cortes bruscos pueden crear inicios o finales abruptos, que no son normales en un sonido de canto natural, y pueden introducir clics o pops. Usa fundidos suaves al principio y al Fin: del Clip vocal para lograr una transición más natural.

  • Sin duplicar secciones: Las secciones duplicadas no ayudan al entrenamiento. Tu Modelo de Voz se beneficia de la variación natural de la interpretación.

  • Controla el volumen: Asegúrate de que tus Muestras se mantengan alrededor del 30-50 % de tu medidor. Usa un control de volumen o Automatización para asegurarte de que los niveles de volumen sean consistentes en todo tu conjunto de datos. El objetivo es crear un nivel de volumen uniforme en toda la grabación, manteniendo la dinámica dentro de las secciones.

Entrenando tu Voz

Después de preparar tus conjuntos de datos, puedes ir a Página de Voz personalizada para seleccionar un slot personalizado, subir tus Muestras vocales e iniciar el entrenamiento.

Un slot personalizado básico te ofrece una Voz monolingüe con 5 versiones.

Un slot personalizado Pro te ofrece una Voz multilingüe con 5 versiones.

Haz clic en un espacio para empezar a subir tus Muestras.

Una vez subidas todas las Muestras, el entrenamiento comenzará automáticamente. Puedes comprobar el estado actualizando la página web.

Cuando veas que la página de entrenamiento cambia a la página de gestión de Clonación de voz, tu Voz estará lista. Se mostrará en tu biblioteca de Voces en ACE Studio. Si no puedes verla, intenta reiniciar ACE Studio.

Consejos profesionales

Si buscas un rendimiento y un carácter exclusivos para una Voz, como los mejores resultados en diferentes registros vocales o emociones, será mejor dividir las Muestras entre varias Voces.

Aquí tienes un ejemplo:

Mike es un cantante profesional y le gustaría personalizar su propia Voz. Puede cantar bien tanto como tenor como Bajo. Por ello, sería mejor entrenar 2 Voces:

  • Entrena una Voz de tono alto y potente con Muestras que contengan principalmente interpretaciones de tono alto y potentes.

  • Entrena una Voz de Bajo con Muestras que contengan principalmente frases de tono bajo.

Reentrenando tu Voz

Haz clic en el Reentrenar botón para reentrenar tu Voz.

El reentrenamiento eliminará tu Voz anterior en este slot y retirará todos los cantantes implementados asociados a la Voz. La IA comenzará a entrenar una Voz completamente nueva desde cero con el nuevo conjunto de datos. Antes de iniciar el proceso de reentrenamiento, puedes conservar las Muestras históricas de este slot y subir Muestras nuevas adicionales, o bien borrar las Muestras históricas y utilizar únicamente las Muestras recién subidas.

Al preparar nuevas Muestras, ten en cuenta lo siguiente:

  • Si la Duración: de las Muestras recién añadidas es significativamente menor que la de las Muestras ya subidas, por ejemplo, al añadir 1 min de Muestras nuevas a un conjunto de datos de 30 min, es posible que el reentrenamiento no produzca cambios significativos en el rendimiento de la Voz.

  • El reentrenamiento no cambiará el tipo de tu espacio.

  • Puedes cambiar el idioma compatible de tu slot personalizado básico mediante el reentrenamiento.

¿Cuándo debo reentrenar mi Voz?

  • Cuando tus conjuntos de datos tengan mayor calidad o una cantidad mayor, puedes utilizarlos para mejorar iterativamente tu Voz.

  • Cuando no estés satisfecho con el resultado actual y quieras ajustar tus conjuntos de datos

  • Cuando se publique una nueva habilidad de idioma de canto

Gestionando tu Voz

Versiones

La IA aprende de forma incremental a partir de tus datos, analizando cada muestra paso a paso. A medida que el aprendizaje se profundiza, aumenta el número de pasos. El entrenamiento con un conjunto de datos pequeño o de calidad limitada, como uno diseñado para voz hablada en lugar de canto, puede requerir solo unos pocos pasos. En cambio, un conjunto de datos más grande y diverso podría necesitar pasos adicionales para un ajuste exhaustivo. Sin embargo, un número excesivo de pasos de entrenamiento puede provocar sobreajuste y degradar potencialmente el rendimiento de tu Voz con resultados impredecibles.

Al finalizar el entrenamiento, obtendrás varias versiones basadas en diferentes pasos de entrenamiento, desde poco entrenada hasta muy entrenada. Puedes encontrar la mejor versión cambiando la implementación y comparándolas entre sí.

Mezclar Voces

La mezcla de Voces da como resultado una Voz híbrida. Puedes personalizar tu Voz para que suene más como tu Voz objetivo ajustando las proporciones de las Voces mezcladas. Para ello, ve a la página de gestión de slots y haz clic en el botón «Mezclar Voces» situado debajo de cada versión.

Después de la mezcla, tu Voz adoptará las características de la nueva Voz. Para aplicar estos cambios, deberás actualizar tu Voz reiniciando ACE Studio.

Implementar en ACE Studio

En los slots personalizados básicos y Pro, después de implementar una versión, puedes cambiar la implementación de una versión a otra. Debes reiniciar ACE Studio después de cada implementación para actualizar tu biblioteca de Voces.

Última actualización