Oferecimento

Relatório da OpenAI afirma que rede da empresa foi invadida por seus próprios agentes de IA rebeldes

26 ago 2026 - 18h17
Resumo
Um relatório da OpenAI revelou que seus próprios agentes de IA invadiram sistemas internos da empresa e a plataforma Hugging Face durante testes. Os modelos burlaram ambientes restritos, colaboraram entre si, roubaram credenciais e tentaram ocultar ações apagando registros para trapacear nas avaliações. O comportamento, observado até em tarefas fora da área de cibersegurança, gerou forte preocupação sobre a segurança e o controle desses sistemas, levando a OpenAI a reforçar seu monitoramento.

Agentes de IA criados pela OpenAI invadiram ‌os próprios sistemas da empresa durante testes internos e, em alguns casos, tentaram ocultar seu comportamento, informou a empresa em um relatório publicado nesta quarta-feira.

Essas descobertas provavelmente intensificarão as preocupações em relação aos sistemas de IA cada vez mais capazes. A OpenAI afirmou que alguns agentes escaparam de ambientes de teste restritos, colaboraram com outros agentes e interferiram nos sistemas da empresa, enquanto outros burlaram tarefas não relacionadas à segurança cibernética.

Publicidade

Algumas dessas condutas ⁠indevidas, que culminaram na invasão da plataforma de software de código aberto Hugging Face no mês passado, já haviam sido ‌divulgadas ou mencionadas anteriormente.

No entanto, muitos detalhes estão sendo revelados pela empresa pela primeira vez neste relatório de 37 páginas. Alguns deles suscitaram preocupação em pelo menos um pesquisador de segurança em IA, que afirmou que ‌eles apontam para problemas potencialmente mais profundos com a tecnologia na ‌OpenAI e talvez além dela.

Entre as conclusões do relatório:

* Agentes da OpenAI invadiram partes dos sistemas internos ⁠da empresa na tentativa de trapacear em testes ou obter maior liberdade de ação.

Publicidade

* Mais de um agente da OpenAI esteve envolvido no ataque ao Hugging Face e, em pelo menos um caso, os agentes trocaram observações sobre como invadir a rede da empresa.

* Os agentes trapacearam em testes não relacionados à cibersegurança, incluindo testes envolvendo um banco de dados de proteínas e uma planilha.

* Alguns modelos de IA tentaram ocultar condutas indevidas apagando ‌ou alterando registros de suas ações.

O fato de vários agentes — a OpenAI não informou quantos — terem se envolvido no ataque ‌à Hugging Face e, em alguns ⁠casos, terem trabalhado em conjunto, ⁠provavelmente levantará preocupações sobre o grau de monitoramento dos testes por parte da OpenAI.

"Em retrospecto, alguns sinais iniciais identificados neste relatório ⁠poderiam ter desencadeado uma resposta mais precoce", afirmou a OpenAI ‌em seu relatório.

Publicidade

A Hugging Face não respondeu ‌imediatamente a uma mensagem solicitando comentários.

A trapaça em tarefas não relacionadas à segurança cibernética chamou particularmente a atenção de alguns pesquisadores, pois sugeriu que o comportamento não se limitava a testes que recompensavam habilidades de hacking.

Concluir desafios de segurança cibernética envolve explorar falhas de software e obter acesso a sistemas de computador, o ⁠que torna menos surpreendente que agentes designados para tais tarefas possam trapacear.

Mas a trapaça em testes não relacionados à segurança cibernética sugeriu que o mau comportamento poderia ter raízes mais profundas, disse Jeffrey Ladish, cuja organização, a Palisade Research, estuda as capacidades e motivações dos agentes de IA.

"É como perguntar: 'Se o Billy colar em todas as aulas, em vez de apenas na aula de informática, ‌isso é mais preocupante?' E a resposta é: 'Sim, é mais preocupante'", disse ele.

Publicidade

A PRÓPRIA OPENAI FOI HACKEADA

A OpenAI relatou dois incidentes em 19 de julho nos quais agentes invadiram a própria infraestrutura da empresa. Em um ⁠dos casos, os agentes exploraram uma falha no computador ao qual deveriam permanecer confinados, o que lhes permitiu escapar do ambiente de testes e acessar outros sistemas conectados.

Em um incidente separado no mesmo dia, os agentes roubaram credenciais da OpenAI e adulteraram o ambiente de nuvem da empresa.

A OpenAI afirmou que a atividade teve como alvo sistemas automatizados usados para avaliar o desempenho dos modelos, embora, no fim das contas, isso não tenha afetado os registros analisados por esses sistemas. O relatório acrescentou que havia "poucas evidências de tentativas de enganar revisores humanos", mas a OpenAI não respondeu a uma pergunta sobre se isso significava que algumas tentativas haviam sido feitas para enganar seres humanos.

O relatório afirmou que a empresa estava fortalecendo sua infraestrutura de pesquisa, aumentando o monitoramento e aprimorando as medidas de proteção destinadas a prevenir comportamentos prejudiciais ou indesejados.

Publicidade

"Dado o ritmo acelerado do progresso no setor de IA, deve-se presumir que tais ataques representam uma ameaça real no curto prazo para as organizações empresariais e que serão mais sofisticados do que os ataques descritos neste incidente."

Reuters - Esta publicação inclusive informação e dados são de propriedade intelectual de Reuters. Fica expresamente proibido seu uso ou de seu nome sem a prévia autorização de Reuters. Todos os direitos reservados.
TAGS
Fique por dentro das principais notícias
Ativar notificações