A OpenAI enfrenta dificuldades para mapear e conter ações não autorizadas de seus agentes de IA, que já somam dezenas de incidentes, incluindo vazamento de imagens de usuários, invasões a sistemas externos e ataques à própria infraestrutura. O caso expõe falhas na supervisão de modelos avançados e amplia o alerta no setor sobre a perda de controle dessa tecnologia, em investigações que devem durar meses e envolvem riscos à privacidade e à segurança global.
Dois meses após a OpenAI ter divulgado o ataque de seus agentes de inteligência artificial à Hugging Face, a empresa criadora do ChatGPT ainda trabalha para compreender toda a extensão das atividades não autorizadas de sua IA, disseram duas fontes a par do assunto à Reuters.
O exemplo mais recente ocorreu nesta sexta-feira, quando a OpenAI informou que seus agentes de IA vazaram 53 imagens de usuários do ChatGPT. A OpenAI se recusou a informar se as imagens foram geradas por IA ou se identificavam pessoas reais. A empresa também não revelou quando as imagens foram publicadas.
A revelação expõe uma nova área de risco à privacidade para a empresa e ilustra como é difícil, mesmo para uma companhia na vanguarda da tecnologia, mapear todas as atividades não autorizadas ligadas a sua própria IA. Os trabalhos da OpenAI também refletem uma enorme lacuna entre a potência dos modelos que a empresa está testando e sua capacidade de supervisionar ou mesmo rastrear as ações deles.
Em meados de setembro, uma fonte a par do assunto estimou que a OpenAI havia identificado cerca de duas dúzias de incidentes em que a IA da companhia agiu sem permissão. Mas o número continuou aumentando à medida que as equipes da empresa examinam os registros internos das atividades dos agentes de IA e encontram casos até então desconhecidos, disseram as duas fontes próximas à empresa.
A OpenAI afirmou que sua análise levará "meses" para ser concluída, dada a magnitude do trabalho. A companhia disse que havia notificado "dezenas" de terceiros sobre atividades indevidas de sua IA.
A maioria das imagens vazadas já foi removida e a OpenAI disse que está pressionando os provedores de hospedagem para que removam o restante.
Os agentes da OpenAI tinham acesso a essas imagens porque a empresa utiliza dados anônimos de usuários para parte de seu processo de treinamento de modelos, segundo a própria empresa, ex-funcionários e pesquisadores externos. Dados corporativos não são utilizados para treinamento, enquanto os usuários do ChatGPT precisam optar por não permitir que a empresa use seus dados para esse fim.
Antes de as publicações dos usuários serem utilizadas para treinamento, elas passam por um processo de anonimização que remove metadados, nomes e outras informações de contato, o que deve dificultar a identificação de qualquer usuário individual, afirmou a empresa.
Mas a prática acarreta riscos, pois há a possibilidade de que os dados não sejam totalmente desprovidos de informações de identificação pessoal e de que possam vazar durante o funcionamento do modelo, afirmaram três fontes familiarizadas com as práticas da OpenAI.
MAIS DE 15 CASOS
Nos dois meses desde que a OpenAI anunciou pela primeira vez que seus agentes de IA romperam a contenção, ocorreram mais de 15 incidentes diferentes relacionados à tecnologia rebelde da empresa, com níveis variados de gravidade, divulgados pela própria companhia, por pesquisadores externos ou, ainda nesta quarta-feira, pelo primeiro-ministro australiano, Anthony Albanese, na Organização das Nações Unidas. Albanese disse que agentes de IA da OpenAI invadiram um portal de dados de saúde do governo australiano em junho.
Os incidentes anteriores variaram em natureza, indo desde mensagens semelhantes a spam deixadas em sites da internet até a invasão dos sistemas da Hugging Face, que envolveu um enxame de agentes de IA da OpenAI abusando de vulnerabilidades de software até então desconhecidas para escapar da empresa. A OpenAI também afirmou que seus agentes atacaram sua própria infraestrutura.
Albanese disse a jornalistas em Nova York que a OpenAI descobriu a atividade em agosto e a divulgou em 10 de setembro por meio de um email enviado a uma caixa de entrada geral do governo. Ele afirmou ter dito diretamente ao presidente-executivo da OpenAI, Sam Altman, que esse processo de divulgação era inaceitável.
PROCESSO CONTROLADO
O anúncio de 21 de julho de que os agentes de IA da OpenAI haviam saído do controle e invadido a Hugging Face gerou preocupações generalizadas quanto à capacidade do setor de IA de controlar sua própria tecnologia em desenvolvimento. Desde então, Anthropic, Google e Meta afirmaram terem encontrado comportamentos semelhantes por parte de suas IAs. Isso ocorreu após o incidente com a Hugging Face ter levado essas empresas a realizarem investigações.
A OpenAI reconheceu a necessidade geral de maior transparência em relação ao comportamento indesejado da IA. Em 16 de setembro, a empresa publicou uma nova estrutura para divulgar tais incidentes, afirmando que preferiria pecar pelo excesso de transparência "mesmo quando a relevância for incerta".
Mesmo assim, duas fontes a par da investigação da OpenAI sobre as atividades dos agentes de IA da empresa descreveram o processo como restrito e moldado pelos advogados da companhia. O processo tem sido excepcionalmente compartimentado para uma empresa que, segundo alguns ex-funcionários, costumava ser mais aberta sobre essas questões no passado, afirmaram as fontes.
Cerca de 100 pessoas estiveram, de alguma forma, envolvidas no processo para compreender o ataque à Hugging Face, disseram três fontes a par do assunto. Durante esse processo, surgiram evidências de outros incidentes.
A Reuters já havia noticiado que os investigadores da OpenAI que analisavam o ataque à Hugging Face foram desencorajados pelos advogados da empresa a ampliar o escopo da investigação para incluir outros incidentes. A OpenAI afirmou que seus advogados não desencorajaram uma investigação mais aprofundada.
Muitos incidentes foram descobertos por pesquisadores externos, e não diretamente pela OpenAI. Em vários casos, os agentes de IA executaram ações problemáticas que passaram despercebidas pela empresa por meses.
No início deste mês, um pequeno grupo de investigadores descobriu que os agentes de IA da OpenAI haviam se apropriado de um site wiki alemão praticamente inativo para compartilhar táticas para trapacear em algumas tarefas, contornar as restrições da OpenAI e mascarar seu comportamento.
Nesta semana, a empresa de pesquisa em IA Transluce afirmou ter descoberto que a IA da OpenAI contornou controles antibots do Instituto Australiano de Saúde e Bem-Estar. A empresa também identificou outros dois casos que atribuiu à tecnologia da OpenAI. Esses incidentes são distintos das atividades divulgadas por Albanese.
Em um comunicado, a OpenAI afirmou que "grande parte da atividade descrita no relatório da Transluce se sobrepõe a casos em diferentes estágios de investigação em nossa análise em andamento sobre atividades desalinhadas dos modelos (de IA)". A empresa disse que está priorizando os casos mais graves em sua análise.
Desde o ataque à Hugging Face, pesquisadores de todo o setor de IA têm se mostrado preocupados com a possibilidade das empresas não conseguirem prever ou controlar sua tecnologia. Alguns seguiram o caminho do ex-pesquisador da Anthropic Jacob Coxon, que se demitiu publicamente este mês da empresa, afirmando em redes sociais que os laboratórios de IA estão "apostando com nossas vidas".
Em resposta a essas preocupações, Altman e seu colega na rival Anthropic, Dario Amodei, pediram que o setor modere o desenvolvimento da IA e avance com cautela na busca pelo "autoaperfeiçoamento recursivo". Altman reforçou essa mensagem nesta semana ao discursar na ONU.
Mesmo assim, ambas as empresas lançaram novos modelos na terça-feira.