Kits e Descript: Ferramentas de IA para Criadores de Áudio

Escrito por
A Equipe Kits
Publicado em
19 de março de 2024
Nos últimos anos da revolução da inteligência artificial, muita atenção tem sido focada no que a IA pode fazer pelos artistas visuais. Bilhões de pessoas têm experimentado ferramentas como o Dall-E, Midjourney e a ferramenta Generative Fill do Photoshop para criar imagens com IA.
Mas você sabia que existem ferramentas semelhantes para projetos de áudio? Músicos, produtores, podcasters, streamers, editores de vídeo e muito mais podem usar a IA para aprimorar cada etapa de seu fluxo de trabalho.
Neste artigo, veremos duas das mais populares ferramentas de áudio de IA: a Kits, uma plataforma de IA vocal para música, e a Descript, um editor de áudio com tecnologia de IA para podcasts.
Ferramentas de IA da Kits para Vocais
A Kits é uma poderosa ferramenta de produção musical que usa IA para criar áudio de alta qualidade. Com a Kits, você pode converter um cantor em outro e clonar a voz de um cantor. As oportunidades criativas são infinitas.
Conversão de Voz
A Kits foi desenvolvida com base no Convert, que muda a voz de um cantor para outra completamente diferente. Embora outras ferramentas de IA façam isso para a fala, a Kits é a primeira a oferecer isso para canto. Os resultados são tão bons que podem se passar por cantores profissionais gravados em um estúdio de ponta, tornando-a uma ferramenta extremamente versátil para produtores.
Basta fazer o upload de um arquivo ou gravar diretamente na aplicação web. Em poucos segundos, sua melodia terá um cantor novinho em folha!
Você pode ajustar a Conversão com controles avançados:
Remova instrumentais, reverb e delay, e/ou vocais de apoio da sua gravação para obter melhores resultados.
Pitch Shift (Deslocamento de Tom): Aumente ou diminua o tom em até 24 semitons.
Conversion Strength (Força de Conversão): Adiciona mais sotaque e articulação à geração, mas pode causar resultados inesperados em níveis elevados.
Volume Blend (Mistura de Volume): Controla o equilíbrio entre o volume de entrada e o modelo. Valores mais baixos revelam mais da dinâmica original.
Efeitos de Pré-Processamento: Reduza ruídos, estrondos e asperezas, suavize o volume e/ou use a equalização antes da geração.
Efeitos pós-processamento: Aplique compressor, coro, reverb e/ou atraso ao resultado.
Tutorial de Treinamento de Voz
O recurso mais futurista da Kits é o Voice Training (Treinamento de Voz). Basta fazer o upload de um arquivo de áudio e a Kits treina um modelo de IA para criar um clone perfeito da voz do cantor. Essa nova Voz pode ser usada em vez de uma voz padrão ou Blended (Misturada) para qualquer conversão (mais sobre isso abaixo).
A Kits oferece a melhor ferramenta de Clonagem de Voz disponível para cantores. Outras ferramentas de IA oferecem isso para fala, incluindo a Descript, que abordaremos em detalhes abaixo. No entanto, a Descript usa essa função principalmente para corrigir erros ou gerar conversões simples de texto em fala. A Kits permite que você use o modelo de voz treinado para conversões sem esforço, o que é uma grande vantagem.

Para treinar a voz, a Kits permite qualquer formato de áudio gravado. Recomenda-se 10 minutos para obter melhores resultados, mas aceita-se até uma hora. (Para comparação, a Descript exige que você leia um roteiro específico para usar como modelo de voz.) A partir daí, basta adicionar um nome e uma foto e, em seguida, treinar sua nova voz! Ela será salva em sua Biblioteca de Vozes para uso futuro.
Biblioteca de Vozes
A Kits oferece mais de 150 vozes de artistas em sua Voice Library (Biblioteca de Vozes). Cada uma é nomeada por seu gênero e estilo musical, como Afrobeats Male (English, Melodic) ou Pop Female (English, Bedroom). Você pode classificar a Biblioteca por faixa de tom, gênero e estilo, e existem até vozes para outros idiomas e estilos de música do mundo. Todas são totalmente livres de royalties, então você pode usá-las como quiser.

Para personalizar ainda mais o seu som, você pode combinar duas Vozes com o Voice Blender (Misturador de Vozes). O controle deslizante Blend Ratio controla quanto de cada voz deve ser usado no treinamento do novo modelo.

Além disso, a Kits oferece instrumentos, incluindo guitarra, baixo, saxofone e violoncelo. Isso permite que você crie instrumentais sem esforço: basta gravar rapidamente a si mesmo cantando ou cantarolando uma parte e depois convertê-la em uma voz instrumental.
Text-To-Speech (Texto para Fala)
A Kits também oferece uma função de texto para fala em 14 idiomas, para narração, dublagens e outros conteúdos falados. Como a Biblioteca de Vozes da Kits é calibrada para canto, os resultados tendem a ser mais naturais do que os de outras IAs. Insira seu roteiro, selecione uma faixa de tom e gere a fala. Toda a Biblioteca de Vozes pode ser usada, além de vozes Misturadas e Treinadas.

Melhoradores de Áudio de IA
Vocal Remover (Removedor de Vocais)
Outra ferramenta musical baseada em IA na Kits é o Vocal Remover. Faça o upload de uma música e o Vocal Remover separa os vocais do instrumental e de outros ruídos de fundo. Configurações avançadas permitem remover os backing vocals e alternar o reverb, o eco e a redução de ruído. Com a IA integrada, o Vocal Remover da Kits tende a fazer um trabalho melhor do que os softwares tradicionais para extrair vocais com precisão, mesmo quando sons semelhantes se sobrepõem.

Masterização com IA
A masterização é a fase final do fluxo de trabalho de produção musical. Compressão, limitação, EQ e outros recursos são aplicados para aperfeiçoar o som final e garantir que as faixas individuais funcionem bem juntas. Historicamente, esse tem sido um dos elementos de produção mais difíceis e caros, mas a IA da Kits permite que até mesmo novos produtores consigam masterizar faixas em segundos.
A Kits oferece seis predefinições de masterização prontas:
Light & Bright (Claro e Brilhante)
Bass Heavy (Grave Intenso)
Punch & Air (Impacto e Espaço)
Lush (Exuberante)
Tape Glue (Cola de Fita)
Analog Warmth (Calor Analógico)
Como o processo é fácil de usar e leva apenas alguns segundos, você pode experimentar para ver qual funciona melhor. Você também pode fazer o upload de uma faixa de referência, cujo som a Kits usará como modelo.

A Kits não é apenas a ferramenta de canto com IA mais poderosa do mercado, mas uma ferramenta essencial para os produtores musicais modernos. Ela usa IA para aprimorar todas as etapas da produção vocal, permitindo produzir vocais melhores com menos tempo, menos dinheiro e mais criatividade.
Descript: Editor de Podcast com IA
A Descript é uma das ferramentas mais poderosas disponíveis atualmente para podcasters, com um rico conjunto de funções de áudio de IA integradas a um editor de podcast baseado em texto. (A Descript também oferece algumas ferramentas de conteúdo de vídeo, mas não entraremos em detalhes aqui.)
Espere, um editor de áudio baseado em texto? Sim, a Descript transcreve automaticamente seu áudio para que você possa editá-lo como se fosse um documento, sendo as alterações refletidas no áudio. Gravações longas são transcritas em poucos segundos e armazenadas de forma segura na nuvem, e cada interlocutor é identificado de maneira automática. Além disso, a ferramenta funciona em 22 idiomas. Somando-se a essa experiência de usuário única, há uma ampla variedade de outras ferramentas de áudio com IA para edição de vídeo:
Vozes de IA
Assim como a Kits, a Descript inclui vozes padrão que podem ser usadas para conversão de texto em fala. Há 21 no total, com marcadores para descrever a voz: Masculina ou Feminina, Jovem, Adulta ou Mais Velha, além de sotaques e estilos.

A Descript também conta com um recurso de clonagem de voz semelhante ao Voice Training da Kits. Curiosamente, a Descript só permite clona a sua própria voz. Para confirmar isso, você deve gravar a si mesmo lendo um roteiro específico para servir de modelo. Sua voz pode ser salva para uso em texto para fala, bem como para futuros Overdubs (dublagens) de sua própria fala.

Regerar Qualquer Transcrição
O recurso Regenerate (Regerar) cria essencialmente um mini clone de voz (sem o processo mais longo descrito acima) e regera uma parte selecionada de texto na gravação da transcrição. Isso permite edições de áudio que seriam impossíveis sem a IA — e pode ser o recurso mais poderoso da Descript.
Por exemplo, digamos que você esteja gravando em casa e a campainha toque. Normalmente, cortar esse momento consumiria bastante tempo, e fazê-lo de forma limpa o suficiente para que os ouvintes não percebam seria quase impossível. Mas com o Descript, basta localizar o momento na transcrição, selecioná-lo e clicar em Replace With → Regenerate. A fala gerada por IA preencherá harmoniosamente essa seção da gravação original.
E se você chamar seu colega de quarto para atender a porta? Você pode excluir facilmente as palavras fora do assunto da transcrição, mas isso deixará um corte óbvio que os ouvintes poderão notar. Basta regerar a frase perto do corte e a voz da IA corresponderá perfeitamente ao tom e à entonação para escondê-lo.
Overdub (Sobradublagem)
Abaixo de Regenerate no menu Replace With está o Overdub. Em vez de usar a voz de IA para suavizar as edições, o Overdub a utiliza para inserir novas palavras no podcast. Se você pronunciar uma palavra incorretamente, errar uma fala ou simplesmente não se expressar tão bem quanto deveria, poderá cortar instantaneamente a parte indesejada e substituí-la por um overdub de IA.
Como a Descript identifica diferentes interlocutores automaticamente, o overdub corresponderá ao locutor correto. Além disso, o novo áudio se alinhará com a qualidade do microfone, os ruídos de fundo e a entonação do áudio ao redor.

Studio Sound (Som de Estúdio)
Com um clique, os algoritmos do Studio Sound fazem qualquer gravação parecer profissional. Basta acionar o botão em Audio Effects que o Studio Sound separa as vozes do ruído de fundo para melhorar ambas. O controle deslizante de intensidade controla a força da aplicação do efeito. A voz será aprimorada de modo que até uma gravação rápida feita no iPhone soará como se tivesse sido captada em um microfone de alta qualidade. Aperfeiçoe seu arquivo de vídeo e remova ruído de fundo, chiados e ecos com etapas simples e intuitivas.
Remoção de Palavras de Preenchimento
Todo podcaster já passou por isso: você grava um episódio e acha que arrasou. Mas quando ouve de volta, sua fala está repleta de "tipo", "hum", silêncios e outros preenchimentos. Infelizmente, essas pequenas coisas podem ter um impacto enorme na forma como você é percebido.
A Remoção de Palavras de Preenchimento está integrada no Descript e, como todos os seus recursos, é incrivelmente simples de usar. Quando sua gravação é transcrita, as palavras de preenchimento são sublinhadas automaticamente. Clique no ícone de estrela e use a ferramenta de edição para "Remover palavras de preenchimento" e "Encurtar intervalos entre palavras" para limpar sua fala.

Como Encontrar a Melhor Ferramenta de IA Para Você
A Kits e a Descript estão na vanguarda da produção de áudio habilitada por IA. Suas ferramentas funcionam de maneira simples e elegante para aprimorar seu fluxo de trabalho atual. Ferramentas poderosas com preços competitivos, como a Conversão de Voz e Treinamento de Voz da Kits e o editor baseado em texto da Descript, abrem possibilidades criativas e dinâmicas que nunca existiram antes. Além disso, recursos como o Vocal Remover e o Mastering de IA no Kits, e o Regenerate e o Filler Word Removal no Descript eliminam os aspectos mais demorados e tediosos da produção de áudio. Como as ferramentas de áudio de IA farão de você um criador melhor?
Comece, grátis.
Otimize seu fluxo de produção vocal com ferramentas de áudio em qualidade de estúdio baseadas em IA.
