Script = https://s1.trrsf.com/update-1786557910/fe/zaz-ui-t360/_js/transition.min.js
PUBLICIDADE
Oferecimento Logo do patrocinador
Publicidade

Como funcionam as ferramentas de inteligência artificial que criam músicas

Sistemas computacionais associam comandos de texto, bancos de áudio e fluxos de dados para compor faixas sonoras

10 set 2026 - 04h58
Compartilhar
Exibir comentários
Resumo
Ferramentas de inteligência artificial, como as desenvolvidas por Google, Nvidia, Meta e Aimi, utilizam comandos de texto, bancos de áudio e aprendizado com dados pré-existentes para gerar, modificar e combinar faixas sonoras e elementos acústicos em tempo real ou sob demanda.

As inteligências artificiais geradoras de música convertem comandos de texto e registros sonoros em arquivos de áudio por meio do processamento de bancos de dados. Modelos criados por empresas de tecnologia analisam parâmetros acústicos, associam palavras a frequências sonoras e executam a composição de faixas em tempo real ou sob demanda.

Foto: Imagem: gerada por IA / Portal Terra / TerrAI

O funcionamento dessas ferramentas depende do treinamento prévio com arquivos de som, partituras ou gravações de estúdio. A partir desse aprendizado, os algoritmos combinam instrumentos, timbres e ritmos de acordo com as instruções fornecidas pelos usuários.

Como o Google MusicLM gera faixas musicais?

O MusicLM, desenvolvido pelo Google, cria faixas musicais a partir de textos, imagens ou legendas enviadas pelos usuários. O sistema foi programado para correlacionar descrições escritas com estruturas sonoras de diferentes gêneros, produzindo arquivos sonoros que atendem aos pedidos de ambientação definidos no comando.

O treinamento do MusicLM incluiu gêneros como jazz e techno, além de referências a períodos históricos e finalidades práticas, como trilhas para treinos esportivos.

Qual é o mecanismo do modelo Fugatto da Nvidia?

O modelo Fugatto, criado pela Nvidia, gera sons a partir de texto e altera áudios pré-existentes. O sistema recebe uma faixa sonora e aplica transformações diretas, como a conversão de melodias de piano em linhas vocais cantadas.

A tecnologia da Nvidia permite também a modificação de sotaques e entonações em registros de fala, além de criar sons a partir da junção de comandos descritivos.

Como a Meta e a startup Aimi processam áudio?

O sistema ImageBind, da Meta, conecta arquivos de áudio a fluxos de texto, vídeo, profundidade tridimensional e dados térmicos em um espaço de representação compartilhado. Essa estrutura permite que a ferramenta gere áudios e vídeos de forma coordenada a partir de diferentes fontes de dados inseridas pelo usuário.

A Aimi adota um processo de composição contínua em transmissões ao vivo. O algoritmo da empresa realiza as etapas de composição, produção, mixagem e masterização em tempo real, utilizando como base de treino inicial composições originais de produtores humanos.

TerrAI Texto gerado com ajuda de Inteligência Artificial e editado pelo nosso time de jornalistas.
Compartilhar

Comentários

Os comentários são de responsabilidade exclusiva de seus autores e não representam a opinião deste site. Se achar algo que viole os termos de uso, denuncie.

Publicidade
Meu Terra