Como funcionam as ferramentas de inteligência artificial que criam músicas
Sistemas computacionais associam comandos de texto, bancos de áudio e fluxos de dados para compor faixas sonoras
Ferramentas de inteligência artificial, como as desenvolvidas por Google, Nvidia, Meta e Aimi, utilizam comandos de texto, bancos de áudio e aprendizado com dados pré-existentes para gerar, modificar e combinar faixas sonoras e elementos acústicos em tempo real ou sob demanda.
As inteligências artificiais geradoras de música convertem comandos de texto e registros sonoros em arquivos de áudio por meio do processamento de bancos de dados. Modelos criados por empresas de tecnologia analisam parâmetros acústicos, associam palavras a frequências sonoras e executam a composição de faixas em tempo real ou sob demanda.
O funcionamento dessas ferramentas depende do treinamento prévio com arquivos de som, partituras ou gravações de estúdio. A partir desse aprendizado, os algoritmos combinam instrumentos, timbres e ritmos de acordo com as instruções fornecidas pelos usuários.
Como o Google MusicLM gera faixas musicais?
O MusicLM, desenvolvido pelo Google, cria faixas musicais a partir de textos, imagens ou legendas enviadas pelos usuários. O sistema foi programado para correlacionar descrições escritas com estruturas sonoras de diferentes gêneros, produzindo arquivos sonoros que atendem aos pedidos de ambientação definidos no comando.
O treinamento do MusicLM incluiu gêneros como jazz e techno, além de referências a períodos históricos e finalidades práticas, como trilhas para treinos esportivos.
Qual é o mecanismo do modelo Fugatto da Nvidia?
O modelo Fugatto, criado pela Nvidia, gera sons a partir de texto e altera áudios pré-existentes. O sistema recebe uma faixa sonora e aplica transformações diretas, como a conversão de melodias de piano em linhas vocais cantadas.
A tecnologia da Nvidia permite também a modificação de sotaques e entonações em registros de fala, além de criar sons a partir da junção de comandos descritivos.
Como a Meta e a startup Aimi processam áudio?
O sistema ImageBind, da Meta, conecta arquivos de áudio a fluxos de texto, vídeo, profundidade tridimensional e dados térmicos em um espaço de representação compartilhado. Essa estrutura permite que a ferramenta gere áudios e vídeos de forma coordenada a partir de diferentes fontes de dados inseridas pelo usuário.
A Aimi adota um processo de composição contínua em transmissões ao vivo. O algoritmo da empresa realiza as etapas de composição, produção, mixagem e masterização em tempo real, utilizando como base de treino inicial composições originais de produtores humanos.
Comentários
Os comentários são de responsabilidade exclusiva de seus autores e não representam a opinião deste site. Se achar algo que viole os termos de uso, denuncie.