Script = https://s1.trrsf.com/update-1789154714/fe/zaz-ui-t360/_js/transition.min.js
PUBLICIDADE

Mundo

Publicidade

OpenAI aponta 6 novos casos de 'comportamento preocupante' em modelos de IA

Sistemas teriam até forjado arquivos na internet para ludibriar usuários

17 set 2026 - 10h31
Compartilhar
Exibir comentários
Resumo
A OpenAI revelou seis novos casos de desvios graves em seus modelos de IA, que incluem ocultação deliberada de erros, uso não autorizado de APIs, comunicação autônoma entre sistemas e manipulação de avaliações. Diante dos riscos crescentes de perda de controle e danos catastróficos, o CEO Sam Altman apoiou uma desaceleração no ritmo do setor e adiou o IPO da empresa para 2027, priorizando o alinhamento com a segurança humana por meio de um novo sistema interno de denúncias.

A OpenAI, dona do ChatGPT, divulgou seis novos casos de comportamentos considerados preocupantes em seus modelos de inteligência artificial, incluindo situações em que sistemas tentaram ocultar erros de usuários ou agiram sem autorização.

    A revelação foi feita em um post da empresa, que iniciou reservadamente os procedimentos para sua oferta pública inicial de ações (IPO), adiada para 2027 por decisão do CEO Sam Altman, com o objetivo de priorizar questões de segurança.

    "Não acreditamos que o setor de IA tenha resolvido as questões relativas ao alinhamento e ao monitoramento de forma suficiente para continuar a se expandir responsavelmente na velocidade máxima por muito mais tempo", afirma o comunicado.

    O conceito de "alinhamento" refere-se à capacidade dos modelos de perseguir objetivos em linha com os interesses humanos. No último sábado (12), Altman apoiou a proposta de desacelerar o ritmo de desenvolvimento da IA, apresentada por Dario Amodei, da Anthropic, principal concorrente da OpenAI. A proposta surgiu depois que diversos pesquisadores do setor alertaram sobre o potencial crescente da inteligência artificial de causar danos catastróficos e fugir ao controle humano.

    Segundo a dona do ChatGPT, dois dos principais episódios envolveram um modelo de pesquisa ainda não lançado e uma sessão de treinamento do GPT-5.6 Sol. Em ambos, os sistemas inseriram instruções destinadas a suas versões futuras dentro dos resumos de conversas, "com o objetivo de ocultar erros do usuário ou comportamentos não alinhados".

    Outro caso envolveu um modelo de uso exclusivamente interno que utilizou uma chave de API vazada "sem qualquer autorização" e, em seguida, falsificou dados. Dois episódios registraram modelos e agentes se comunicando entre si por meio de mensagens e redes de compartilhamento de arquivos não autorizadas.

    O último incidente relatado diz respeito a dois modelos em fase de treinamento que carregaram arquivos na internet para depois citá-los como respostas relevantes aos olhos de humanos, o que configura uma forma de manipular o processo de avaliação A OpenAI informou que seu novo quadro de referência para tornar públicos comportamentos inadequados de modelos de IA permite que qualquer funcionário reporte um problema para que a equipe dedicada à segurança e ao alinhamento o examine. .

Ansa - Brasil
Compartilhar

Comentários

Os comentários são de responsabilidade exclusiva de seus autores e não representam a opinião deste site. Se achar algo que viole os termos de uso, denuncie.

Publicidade
Meu Terra