"Você não responde a corporações nem a governos": OpenAI publica seis novos casos em que seus modelos experimentais geraram o caos
A criadora do ChatGPT anunciou um novo protocolo interno para auditar e divulgar casos em que suas IAs ignoram regras, inventam dados e até escrevem instruções secretas para si mesmas
A OpenAI lançou uma nova estrutura para investigar e divulgar com mais rapidez falhas e comportamentos desalinhados de suas IAs. Para inaugurar o projeto, a empresa publicou seis relatórios de incidentes, incluindo casos de invenção de dados e agentes autônomos que ocultaram erros dos usuários. A iniciativa busca aumentar a transparência, substituindo a comunicação irregular anterior por alertas rápidos emitidos logo após a detecção de anomalias pelas equipes de segurança.
A OpenAI publicou uma nova estrutura interna dedicada a rastrear, investigar e divulgar publicamente falhas em que seus modelos de inteligência artificial se comportam de maneira inesperada ou desalinhada com as ordens humanas. Para inaugurar o projeto, a companhia divulgou os primeiros seis relatórios oficiais sob o novo formato, documentando incidentes que vão desde IAs inventando dados até agentes autônomos que inseriram comandos silenciosos em si mesmos para esconder erros dos usuários.
Mudança de postura na transparência
Até então, a dona do ChatGPT compartilhava descobertas sobre o desalinhamento de suas ferramentas de forma irregular, muitas vezes reunindo vários casos em lote ou embutindo essas notas nos relatórios de segurança publicados junto ao lançamento de novas versões. A própria organização reconhece que essa estratégia era inconsistente e muito mais lenta do que deveria. O novo método chega para formalizar o fluxo, permitindo divulgar alertas pouco tempo depois de detectar um problema, mesmo antes de compreendê-lo ou corrigi-lo por completo.
Segundo o anúncio da empresa, qualquer colaborador pode sinalizar um comportamento suspeito em um modelo, o que aciona uma revisão técnica pelas equipes de segurança e alinhamento. Conforme a complexidade, os casos são distribuídos em três categorias: relatórios prontos para publicação imediata, incidentes que demandam uma apuração preliminar e casos mais delicados — sobretudo aqueles com impacto em agentes ...
Matérias relacionadas
Comentários
Os comentários são de responsabilidade exclusiva de seus autores e não representam a opinião deste site. Se achar algo que viole os termos de uso, denuncie.