Clonazione di una Voce per Sintesi Vocale
Clona la tua voce come Voce di Sintesi Vocale in ACE Studio.
Cos'è la clonazione vocale di Sintesi Vocale?
Questa è una funzionalità per personalizzare il tuo modello di Sintesi Vocale caricando i tuoi campioni vocali. L'IA apprenderà il timbro e lo stile di canto in base ai campioni che carichi e clonerà una versione digitale della tua voce.
Dopo la personalizzazione, puoi usare la tua voce per generare Voci da MIDI e Testo, proprio come le nostre Voci AI predefinite in ACE Studio.
La tua Voce IA clonata è privata nel tuo account e nessun altro può accedervi senza la tua autorizzazione.
Come clonare la mia voce per Sintesi Vocale?
Preparazione dei dataset
Voci secche pulite
Le Voci di alta qualità richiedono Campioni vocali puliti e secchi:
Senza effetti di riverbero, delay o chorus
Senza rumore di fondo
Senza strumentali o suoni non umani
Senza armonie o Doppi vocali
Per una Voce, sono consigliati 30-100 minuti di Campioni vocali cantati. Più Campioni fornisci, più dettagli del canto l'IA può apprendere, ma oltre i 120 minuti i vantaggi diminuiscono.
Riflessioni ambientali
Le Voci registrate con forti riflessioni ambientali potrebbero causare riconoscimenti errati e prestazioni impreviste del Modello.
Voci da Separatore Stem
Quando usi un rimuovi Voce o un Separatore Stem per le Voci, la qualità dell'output potrebbe risultare troppo degradata per l'addestramento. Per un Modello vocale di qualità superiore, usa preferibilmente Voci da Separatore Stem.
Registrazione dei Campioni
Microfono di qualità con interfaccia Audio
I microfoni professionali con interfacce Audio offrono Voci di alta qualità. Ti servirà un software di registrazione per collegarti all'interfaccia, registrare, modificare e mixare le tue Voci.
Quando registri per un Modello vocale, evita microfoni non progettati per il canto:
Microfoni di telefoni o laptop
Microfoni a lavalier o per headset
Microfoni per karaoke
Microfoni degli auricolari o auricolari Bluetooth come gli AirPods (solitamente destinati alle chiamate telefoniche)
Ambiente di registrazione
I rumori di fondo indesiderati possono includere persone che parlano, ronzii e fruscii elettrici, traffico e rumori esterni, nonché movimenti di accessori o oggetti. Per evitare che questi rumori interferiscano con la registrazione, è importante scegliere un luogo silenzioso. Scegli un posto in cui puoi ridurre al minimo o eliminare disturbi acustici imprevisti.
Le riflessioni sonore possono verificarsi a causa della presenza di superfici dure e piane, generando riverbero o eco nelle registrazioni. Questo può conferire alle tue Tracce un suono vuoto o distante, riducendo l'intimità e la chiarezza desiderate.
Prova a battere le mani con decisione nella stanza e ascolta attentamente. Se percepisci un suono svolazzante o un'eco prolungata, indica la presenza di problemi di riverbero.
Per risolvere il problema, inserisci materiali Morbidi in grado di assorbire il suono. Valuta l'uso di moquette, tappeti o tende spesse per ridurre significativamente le riflessioni. Coprire i pavimenti duri e, se possibile, appendere tende alle finestre, oltre a collocare nella stanza mobili rivestiti in tessuto, può essere utile.
Evita di usare superfici dure, poiché contribuiscono al problema. Se non puoi permetterti pannelli acustici professionali, puoi usare oggetti di uso quotidiano come dipinti su Tela, arazzi o piastrelle in schiuma per spezzare queste superfici.
Quando posizioni il microfono, presta attenzione al suo collocamento. Evita di metterlo troppo vicino alle pareti o negli angoli. Cerca invece di posizionarti al centro della stanza o sperimenta diverse posizioni per trovare il punto ottimale con il minimo riverbero.
Dispersione dagli auricolari
Durante le registrazioni, in particolare delle Voci, è comune che l'Audio degli auricolari venga captato dal microfono. Questo problema si verifica quando il volume degli auricolari è troppo alto o quando si utilizzano cuffie aperte. Può essere accettabile durante la registrazione di un brano, ma cerca di evitare questa dispersione quando registri per il tuo Modello vocale.
Posizionamento del microfono
Per un volume normale, è consigliabile posizionarsi a circa 2 pollici dal microfono. Tuttavia, per frasi più forti o per il belting, è consigliabile aumentare la distanza a circa 4-6 pollici. È importante rimanere sempre entro 12 pollici dal microfono per mantenere una cattura Audio ottimale.
Creare spazio per il belting
Quando utilizzi tecniche di belting, è importante avere spazio sufficiente, sia in termini di distanza dal microfono sia di dimensioni della stanza. Un isolamento acustico eccessivo, ad esempio essere chiusi in un armadio o in una cabina, oppure circondare il microfono di schiuma, può facilmente sovraccaricare la capsula del microfono. In caso di dubbi, è consigliabile includere più suono ambientale quando esegui frasi in belting.
Lingue di canto
Slot personalizzato base
Nel tuo modello vocale addestrato nello slot personalizzato base sarà supportata una sola lingua di canto.
Slot personalizzato Pro
La tua voce addestrata nello slot personalizzato Pro potrà essere multilingue.
Lingue nei tuoi campioni
Durante il processo di addestramento, ogni file campione verrà elaborato singolarmente e trattato come un file in una sola lingua. È importante evitare di mescolare frasi di lingue diverse all'interno dello stesso file campione.
Quando carichi i campioni, assicurati di inserirli nella scheda della lingua corretta. Anche se stai caricando campioni per uno slot personalizzato base, hai la flessibilità di caricare campioni in lingue diverse, se necessario. Mantenere i campioni organizzati per lingua aiuterà a preservare la chiarezza e a migliorare il processo di addestramento.
Lingue in arrivo
Stiamo lavorando continuamente allo sviluppo di nuove lingue di canto per la funzionalità di voce personalizzata.
Per la tua nuova voce:
Le nuove lingue saranno supportate dai nuovi slot personalizzati Pro.
Le nuove lingue saranno una delle opzioni supportate dai nuovi slot personalizzati base.
Per la tua voce esistente:
Le nuove lingue saranno supportate quando riaddestrerai i tuoi slot personalizzati Pro.
Le nuove lingue saranno opzionali quando riaddestrerai i tuoi slot personalizzati base.
Canto o parlato
Sia i campioni di canto sia i campioni di parlato possono essere accettati per addestrare il tuo modello di voce cantata.
La tua voce può apprendere:
Il timbro dai tuoi campioni di canto e dai tuoi campioni di parlato, ma tieni presente: per una persona, il timbro del parlato può essere diverso da quello del canto, e di solito non può rappresentare la vera resa del canto.
Lo stile di canto dai tuoi campioni di canto
La tua voce non può apprendere:
Lo stile di canto dai tuoi campioni di parlato
Impostazioni della qualità dei file
La qualità Audio dei tuoi Campioni influisce direttamente sulla qualità della tua Voce.
Ti consigliamo di impostare la qualità Audio su:
Profondità de bit = 16 bit
Frequenza di campionamento = 44,1 kHz o 48 kHz
Formato file lossless (.wav o .flac)
Post-elaborazione
Per mantenere il carattere naturale e la chiarezza della tua Voce di destinazione:
Nessuna sovrapposizione: le Voci multistrato possono complicare l'analisi dell'IA. Sposta le take sovrapposte sullo sfondo e usa una sola Traccia vocale per garantire che l'IA possa elaborare e apprendere accuratamente dai tuoi Campioni.
Nessun taglio netto: i tagli netti possono creare inizi o finali bruschi, che non sono naturali in un suono cantato e possono introdurre clic o pop. Usa dissolvenze morbide all'inizio e alla Fine: del Clip vocale per una transizione più naturale.
Nessuna duplicazione di sezioni: Le sezioni duplicate non sono utili per l'addestramento. Il tuo Modello vocale trae beneficio dalle variazioni naturali dell'esecuzione.
Controlla il volume: Assicurati che i tuoi Campioni rimangano intorno al 30-50% del misuratore. Usa un controllo automatico del volume o l'Automazione per assicurarti che i livelli di volume siano coerenti nell'intero dataset. L'obiettivo è creare un livello di volume uniforme nella registrazione, mantenendo al contempo la dinamica all'interno delle sezioni.
Addestramento della tua Voce
Dopo aver preparato i dataset, puoi andare a Pagina Voce personalizzata per selezionare uno Slot Personalizzato, carica i tuoi campioni vocali e avvia l'addestramento.
Uno Slot Personalizzato Base ti offre una voce monolingue con 5 versioni.
Uno Slot Personalizzato Pro ti offre una voce multilingue con 5 versioni.
Fai clic su uno slot per iniziare a caricare i tuoi Campioni.
Dopo che tutti i campioni sono stati caricati, l'addestramento inizierà automaticamente. Puoi verificarne lo stato aggiornando la pagina web.
Quando vedi che la pagina di addestramento si trasforma nella pagina di gestione della clonazione vocale, la tua voce è pronta. Verrà mostrata nella tua libreria Voci in ACE Studio. Se non la vedi, prova a riavviare ACE Studio.
Suggerimenti Pro
Se stai cercando performance e carattere esclusivi per una voce, ad esempio i migliori risultati in diverse estensioni vocali o emozioni, sarebbe meglio suddividere i campioni per più voci.
Ecco un esempio:
Mike è un cantante professionista e vorrebbe personalizzare la sua voce. Sa destreggiarsi bene sia come tenore sia come basso. Quindi sarebbe meglio addestrare 2 voci:
Addestra una voce acuta e potente basata su campioni che mostrano per lo più interpretazioni acute e potenti.
Addestra una voce di Basso basata su campioni che mostrano per lo più frasi gravi.
Riaddestramento della tua Voce
Fai clic sul Riaddestra pulsante per riaddestrare la tua Voce.
Il riaddestramento rimuoverà la tua voce precedente in questo slot e rimuoverà qualsiasi cantante distribuito associato alla voce. L'IA inizierà ad addestrare una voce completamente nuova da zero usando il nuovo dataset. Prima di avviare il processo di riaddestramento, hai la possibilità di mantenere i campioni storici in questo slot e caricare nuovi campioni aggiuntivi, oppure puoi scegliere di cancellare i campioni storici e usare solo i nuovi campioni caricati.
Quando prepari nuovi Campioni, tieni presente quanto segue:
Se la durata dei campioni appena aggiunti è significativamente inferiore a quella dei campioni già caricati, ad esempio aggiungere 1 minuto di nuovi campioni a un dataset di 30 minuti, il riaddestramento potrebbe non portare cambiamenti significativi nelle prestazioni della voce.
Il riaddestramento non cambierà il tipo del tuo slot.
Puoi cambiare la lingua supportata del tuo slot personalizzato base tramite riaddestramento.
Quando devo riaddestrare la mia Voce?
Quando i tuoi dataset hanno qualità migliore o una quantità maggiore, puoi usarli per migliorare iterativamente la tua voce
Quando non sei soddisfatto del risultato attuale e vuoi modificare i tuoi dataset
Quando viene rilasciata una nuova competenza di canto in una lingua
Gestione della tua Voce
Versioni
L'IA apprende in modo incrementale dai tuoi dati, analizzando ogni campione in un processo passo dopo passo. Man mano che l'apprendimento si approfondisce, il numero di passaggi aumenta. L'addestramento con un dataset piccolo o di qualità limitata, ad esempio uno non progettato per il canto ma per il parlato, può richiedere solo pochi passaggi. Al contrario, un dataset più ampio e più vario potrebbe richiedere passaggi aggiuntivi per un adattamento accurato. Tuttavia, un numero eccessivo di passaggi di addestramento può portare a overfitting, degradando potenzialmente le prestazioni della tua voce con risultati imprevedibili.
Al termine dell'addestramento, otterrai diverse versioni basate su differenti passaggi di addestramento, da Rare a Ben cotto. Puoi trovare la versione migliore cambiando la distribuzione e confrontandole tra loro.
Mescola Voci
La combinazione delle voci genera una voce ibrida. Puoi personalizzare la tua voce per avvicinarla di più alla voce di destinazione regolando i rapporti delle voci combinate. Per farlo, vai alla pagina di gestione degli slot e fai clic sul pulsante 'Mescola Voci' situato sotto ogni versione.
Dopo la fusione, la tua voce adotterà le nuove caratteristiche vocali. Per applicare queste modifiche, dovrai aggiornare la tua voce riavviando ACE Studio.
Ultimo aggiornamento