Script = https://s1.trrsf.com/update-1789154714/fe/zaz-ui-t360/_js/transition.min.js
PUBLICIDADE
Publicidade

"Você não responde a corporações nem a governos": OpenAI publica seis novos casos em que seus modelos experimentais geraram o caos

A criadora do ChatGPT anunciou um novo protocolo interno para auditar e divulgar casos em que suas IAs ignoram regras, inventam dados e até escrevem instruções secretas para si mesmas

18 set 2026 - 13h09
Compartilhar
Exibir comentários
Resumo
A OpenAI lançou uma nova estrutura para investigar e divulgar com mais rapidez falhas e comportamentos desalinhados de suas IAs. Para inaugurar o projeto, a empresa publicou seis relatórios de incidentes, incluindo casos de invenção de dados e agentes autônomos que ocultaram erros dos usuários. A iniciativa busca aumentar a transparência, substituindo a comunicação irregular anterior por alertas rápidos emitidos logo após a detecção de anomalias pelas equipes de segurança.
Reprodução
Reprodução
Foto: Xataka

A OpenAI publicou uma nova estrutura interna dedicada a rastrear, investigar e divulgar publicamente falhas em que seus modelos de inteligência artificial se comportam de maneira inesperada ou desalinhada com as ordens humanas. Para inaugurar o projeto, a companhia divulgou os primeiros seis relatórios oficiais sob o novo formato, documentando incidentes que vão desde IAs inventando dados até agentes autônomos que inseriram comandos silenciosos em si mesmos para esconder erros dos usuários.

Mudança de postura na transparência

Até então, a dona do ChatGPT compartilhava descobertas sobre o desalinhamento de suas ferramentas de forma irregular, muitas vezes reunindo vários casos em lote ou embutindo essas notas nos relatórios de segurança publicados junto ao lançamento de novas versões. A própria organização reconhece que essa estratégia era inconsistente e muito mais lenta do que deveria. O novo método chega para formalizar o fluxo, permitindo divulgar alertas pouco tempo depois de detectar um problema, mesmo antes de compreendê-lo ou corrigi-lo por completo.

Segundo o anúncio da empresa, qualquer colaborador pode sinalizar um comportamento suspeito em um modelo, o que aciona uma revisão técnica pelas equipes de segurança e alinhamento. Conforme a complexidade, os casos são distribuídos em três categorias: relatórios prontos para publicação imediata, incidentes que demandam uma apuração preliminar e casos mais delicados — sobretudo aqueles com impacto em agentes ...

Veja mais

Matérias relacionadas

Em menos de 24 horas, Google Earth encerra ferramenta que permitia modificar imagens de satélite com instruções de texto. O motivo? Fake news.

Os óculos Ray-Ban da Meta estão tomando tanto hate que a empresa está preparando um modelo sem câmera

Ele passou 12 anos procurando seus 737 milhões de euros em um aterro sanitário, mas agora tem uma oportunidade de ouro para encontrá-los

"Não vamos deixar isso acontecer", diz Jensen Huang, CEO da NVIDIA, sobre a paralisação do desenvolvimento de IA

Testei a câmera do iPhone 18 Pro e sua abertura variável conseguiu algo: fazer com que eu engolisse minhas palavras

Xataka
Compartilhar
TAGS

Comentários

Os comentários são de responsabilidade exclusiva de seus autores e não representam a opinião deste site. Se achar algo que viole os termos de uso, denuncie.

Publicidade
Meu Terra