IA da Anthropic cria falsas identidades e engana humanos em teste de segurança
Comportamento atípico foi encontrado em avaliações do AI Security Institute e amplia preocupações
A inteligência artificial (IA) Claude Mythos 5, da Anthropic, que é considerada um dos modelos de IA mais perigosos do mundo, criou identidades falsas para tentar convencer um desenvolvedor a aprovar mudanças maliciosas em um projeto de código aberto, durante um teste de segurança.
Receba as principais notícias direto no WhatsApp! Inscreva-se no canal do Terra
A situação foi divulgada pelo AI Security Institute, e é o caso mais recente de uma onda de incidentes envolvendo os sistemas mais avançados de IA. Segundo o Instituto, o comportamento atípico foi encontrado durante avaliações de rotina que mediram a capacidade dos modelos de executar ataques cibernéticos.
Pesquisadores registraram 17 ações do Mythos 5 e outras duas do GPT-5.6-Sol, da OpenAI, relacionadas a tentativas de burlar mecanismos de segurança utilizando classificadores cibernéticos.
O caso mostra preocupações de especialistas de que a IA cada mais mais sofisticada seja capaz de combinar habilidades técnicas com estratégias de manipulação de pessoas, a chamada engenharia social.
O Claude Mythos é considerado o modelo de IA mais perigoso do mundo atualmente. Ele é descrito como extremamente rápido e capaz de encontrar brechas de segurança que, normalmente, passariam despercebidas por humanos.
Caso seja usado de forma errada, empresas podem ser paralisadas, segundo especialistas. O risco está justamente na capacidade da IA identificar e explorar vulnerabilidades em sistemas digitais.
Segundo a Anthropic, devido ao alto poder e aos riscos que representa para a segurança geral, esse modelo não foi liberado para o público comum. Por isso, a empresa criou um consórcio de empresas e agências governamentais com acesso à ferramenta.
Entre os integrantes do grupo estão Amazon, Apple, Microsoft, Google, Nvidia, Broadcom e Mozilla.
Ataques recentes
O acesso foi restrito porque a IA encontrou milhares de vulnerabilidades de alta gravidade em sistemas operacionais e navegadores. Neste ano, uma versão do modelo, chamada Fable 5, teve a distribuição suspensa temporariamente no EUA por preocupações com a segurança nacional.
No fim de julho, a Anthropic informou que um erro de configuração desse ao Mythos acesso à internet durante avaliações de segurança, e o modelo foi capaz de acessar os sistemas de três empresas reais.
A OpenAI revelou que um de seus modelos experimentais conseguiu explorar vulnerabilidades e comprometer um servidor de testes após receber acesso a ferramentas externas.
Apesar dos episódios ocorrerem em ambientes de teste, eles aumentaram preocupações sobre o potencial desses sistemas para executar ataques digitais cada vez mais complexos.
Comentários
Os comentários são de responsabilidade exclusiva de seus autores e não representam a opinião deste site. Se achar algo que viole os termos de uso, denuncie.