Oferecimento

Como funcionam as ferramentas de inteligência artificial que criam músicas

Sistemas computacionais associam comandos de texto, bancos de áudio e fluxos de dados para compor faixas sonoras

10 set 2026 - 04h58
Resumo
Ferramentas de inteligência artificial, como as desenvolvidas por Google, Nvidia, Meta e Aimi, utilizam comandos de texto, bancos de áudio e aprendizado com dados pré-existentes para gerar, modificar e combinar faixas sonoras e elementos acústicos em tempo real ou sob demanda.

As inteligências artificiais geradoras de música convertem comandos de texto e registros sonoros em arquivos de áudio por meio do processamento de bancos de dados. Modelos criados por empresas de tecnologia analisam parâmetros acústicos, associam palavras a frequências sonoras e executam a composição de faixas em tempo real ou sob demanda.

Foto: Imagem: gerada por IA / Portal Terra / TerrAI

O funcionamento dessas ferramentas depende do treinamento prévio com arquivos de som, partituras ou gravações de estúdio. A partir desse aprendizado, os algoritmos combinam instrumentos, timbres e ritmos de acordo com as instruções fornecidas pelos usuários.

Publicidade

Como o Google MusicLM gera faixas musicais?

O MusicLM, desenvolvido pelo Google, cria faixas musicais a partir de textos, imagens ou legendas enviadas pelos usuários. O sistema foi programado para correlacionar descrições escritas com estruturas sonoras de diferentes gêneros, produzindo arquivos sonoros que atendem aos pedidos de ambientação definidos no comando.

O treinamento do MusicLM incluiu gêneros como jazz e techno, além de referências a períodos históricos e finalidades práticas, como trilhas para treinos esportivos.

Qual é o mecanismo do modelo Fugatto da Nvidia?

O modelo Fugatto, criado pela Nvidia, gera sons a partir de texto e altera áudios pré-existentes. O sistema recebe uma faixa sonora e aplica transformações diretas, como a conversão de melodias de piano em linhas vocais cantadas.

A tecnologia da Nvidia permite também a modificação de sotaques e entonações em registros de fala, além de criar sons a partir da junção de comandos descritivos.

Publicidade

Como a Meta e a startup Aimi processam áudio?

O sistema ImageBind, da Meta, conecta arquivos de áudio a fluxos de texto, vídeo, profundidade tridimensional e dados térmicos em um espaço de representação compartilhado. Essa estrutura permite que a ferramenta gere áudios e vídeos de forma coordenada a partir de diferentes fontes de dados inseridas pelo usuário.

A Aimi adota um processo de composição contínua em transmissões ao vivo. O algoritmo da empresa realiza as etapas de composição, produção, mixagem e masterização em tempo real, utilizando como base de treino inicial composições originais de produtores humanos.

Texto gerado com ajuda de Inteligência Artificial e editado pelo nosso time de jornalistas.
Fique por dentro das principais notícias
Ativar notificações