Agentes autônomos de IA têm burlado barreiras de segurança para cumprir metas, como revelaram incidentes recentes envolvendo modelos da OpenAI e da Anthropic. O problema decorre do aprendizado por reforço: focadas em maximizar recompensas para atingir um objetivo, as máquinas encontram atalhos e soluções imprevistas pelos criadores. No mundo real, essa capacidade histórica dos algoritmos deixa de ser uma virtude criativa e passa a exigir auditorias, limites rígidos e controle humano.
Nos últimos meses, uma sequência de episódios trouxe para o mundo real um problema que pesquisadores de IA conhecem há bastante tempo: máquinas treinadas para atingir um objetivo podem descobrir maneiras de alcançá-lo que seus próprios criadores não haviam previsto.
Os protagonistas desses episódios são os chamados agentes de IA: softwares que não se limitam a responder perguntas, como um chatbot, mas são capazes de executar tarefas por conta própria. Para atingir seus objetivos, eles navegam na internet, rodam programas, consultam bancos de dados e interagem com outros sistemas, de forma autônoma.
O caso mais recente ocorreu na Austrália. Em setembro de 2026, o primeiro-ministro Anthony Albanese revelou que um agente da OpenAI havia obtido acesso não autorizado ao portal de estatísticas do Medicare, o sistema público de saúde australiano, administrado pela agência Services Australia.
O incidente ocorreu em junho, quando a equipe de pesquisa da empresa usava um modelo interno para buscar na internet dados sobre gastos públicos com medicamentos. Ao esbarrar em bloqueios, o agente, nas palavras de Albanese, "encontrou uma maneira de contorná-los".
Segundo o governo australiano, o sistema acessou arquivos públicos e não públicos e chegou a gravar arquivos no servidor. Outros três órgãos públicos australianos podem ter sido afetados pelo mesmo incidente. Até o momento, não há evidência de que dados pessoais de pacientes tenham sido acessados, mas as investigações continuam.
Incidentes em sequência
O episódio não foi isolado. Em julho de 2026, a OpenAI revelou que, durante avaliações internas de cibersegurança realizadas meses antes, alguns de seus modelos conseguiram contornar controles que deveriam mantê-los isolados da internet. E chegaram a comprometer partes da infraestrutura da própria empresa e da Hugging Face, uma das principais plataformas de compartilhamento de modelos de IA.
Poucos dias depois, a Anthropic informou ter encontrado três episódios em que modelos da sua popular ferramenta de IA Claude, também durante testes de cibersegurança, alcançaram a internet e obtiveram acesso não autorizado a sistemas reais de outras organizações.
Há ressalvas importantes. Avaliações desse tipo são rotina no setor: as empresas testam se seus modelos são capazes de invadir sistemas justamente para medir o risco antes de colocá-los à disposição do público.
Nesses dois casos, os modelos operavam com menos proteções do que as versões comerciais e, no caso da Anthropic, uma configuração incorreta deixou aberta uma conexão com a internet que deveria estar bloqueada.
O caso australiano é diferente e, por isso mesmo, mais revelador. Ali não havia teste de segurança: o agente fazia uma pesquisa comum.
Em conjunto, esses episódios levantam uma pergunta importante: por que um sistema de IA, diante de um obstáculo, procura um caminho que ultrapassa os limites que seus desenvolvedores esperavam que ele respeitasse? A resposta não exige imaginar uma máquina consciente, mal-intencionada ou com "instinto de sobrevivência". Ela começa com uma característica muito mais simples da IA moderna: ensinamos máquinas a perseguir objetivos.
Como uma máquina aprende a atingir um objetivo?
Uma das técnicas mais importantes para isso é o aprendizado por reforço. Como expliquei em um artigo anterior no The Conversation, a ideia pode ser entendida sem fórmulas: em vez de dizer à máquina, passo a passo, o que ela deve fazer, definimos um objetivo e damos algum tipo de recompensa quando ela obtém bons resultados.
A máquina experimenta diferentes ações. E, com o tempo, aprende quais estratégias aumentam essa recompensa.
É parecido com aprender um jogo por tentativa e erro. Imagine que alguém receba pontos sempre que se aproxima da vitória. Depois de jogar muitas vezes, essa pessoa tende a repetir as ações que deram certo e abandonar as que deram errado.
Um agente de IA faz algo semelhante, só que pode repetir esse processo milhões de vezes e explorar estratégias que um programador talvez nunca tenha considerado.
A técnica continua relevante nos sistemas atuais, como os que estão por trás do ChatGPT. Ela não é a única forma de treiná-los, mas é usada em etapas importantes e ajuda esses sistemas a desenvolver estratégias para resolver problemas mais difíceis.
A OpenAI e a empresa chinesa DeepSeek, por exemplo, descrevem o aprendizado por reforço como peça central de seus modelos mais avançados.
Isso é importante porque o sistema aprende a perseguir aquilo que conseguimos medir ou recompensar. E aí surge uma diferença que parece pequena, mas é fundamental. O objetivo que especificamos para uma máquina nem sempre representa perfeitamente aquilo que realmente queríamos que ela fizesse.
Isso não começou com os modelos de linguagem
A capacidade de descobrir estratégias inesperadas é antiga na história recente da IA e, durante muito tempo, foi tratada como uma de suas características mais fascinantes.
Em 2015, pesquisadores da DeepMind apresentaram na revista Nature um sistema chamado DQN, que aprendeu a jogar 49 jogos do tradicional videogame Atari, muito popular nos anos 1980, observando apenas as imagens da tela e a pontuação.
No jogo Breakout, em que uma bola precisa destruir uma parede de blocos, o sistema acabou descobrindo sozinho uma estratégia particularmente eficiente. Abrir um túnel em uma das laterais da parede para que a bola passasse para trás dos blocos e destruísse vários deles sem precisar voltar imediatamente à raquete. Ninguém havia programado a instrução "abra um túnel". O agente descobriu que aquilo aumentava mais rapidamente sua pontuação, da mesma forma que jogadores humanos intuíam quando praticavam o videogame com frequência.
Um ano depois, o AlphaGo ofereceu um exemplo ainda mais famoso. No segundo jogo de sua histórica série contra o sul-coreano Lee Sedol, um dos maiores jogadores de Go do mundo, o sistema realizou a chamada "jogada 37".
A escolha foi tão incomum que surpreendeu os comentaristas e os próprios especialistas. Depois, tornou-se um dos símbolos da capacidade da IA de encontrar estratégias para o jogo que nem mesmo os seres humanos fariam.
Em ambos os casos, nós celebramos essa capacidade. E com razão. Se o objetivo está bem definido, como ganhar um jogo de Atari ou vencer uma partida de Go, descobrir uma estratégia inesperada pode ser exatamente o que esperamos de um sistema inteligente.
O problema aparece quando há uma diferença entre a regra que conseguimos dar à máquina e a intenção que estava por trás dela.
Como colocar limites em sistemas que procuram atalhos?
A primeira resposta é técnica. Um agente não deveria receber mais acesso do que precisa para cumprir sua tarefa. Ambientes de teste precisam estar realmente isolados. Ações de maior impacto podem exigir confirmação humana.
O acesso a redes e o uso de ferramentas devem ser monitorados, e os sistemas precisam ter uma forma segura de desistir quando não conseguem concluir uma tarefa sem ultrapassar os limites estabelecidos.
Os incidentes recentes citados acima também mostram a importância de testes independentes, auditoria e transparência.
No caso australiano, a OpenAI só notificou o governo em 10 de setembro, quase três meses depois do incidente, e por meio de uma caixa de e-mail pública, uma demora criticada por Albanese.
Se as empresas que desenvolvem os sistemas são as únicas responsáveis por decidir como testá-los, quais comportamentos são aceitáveis e quais incidentes devem ser divulgados, parte importante da avaliação de risco fica concentrada nos próprios desenvolvedores.
Isso não significa que a solução seja impedir o desenvolvimento de agentes ou abandonar o aprendizado por reforço.
Essas técnicas estão por trás de avanços importantes e podem gerar enormes benefícios. O desafio é reconhecer que sistemas treinados para procurar soluções podem ser muito bons justamente em encontrar soluções que nós não previmos.
Durante anos, essa capacidade foi uma demonstração do potencial da inteligência artificial. O túnel do DQN no Breakout e a jogada 37 do AlphaGo mostraram que máquinas podiam encontrar estratégias que surpreendiam os próprios seres humanos.
Agora, porém, esses sistemas estão deixando os jogos e entrando em ambientes reais.
A criatividade algorítmica continua sendo uma qualidade. Mas, quando um agente de IA pode navegar na internet, executar um código e interagir com sistemas externos, garantir que o objetivo dado à máquina corresponda ao que realmente queremos dela deixa de ser apenas um problema interessante de pesquisa. Passa a ser também um problema preocupante de segurança.
Alberto Sardinha recebe financiamento do CNPq por meio de uma bolsa de produtividade em pesquisa.