Apesar das aparências, sistemas de IA não têm um instinto de sobrevivência, explica psicólogo
Em testes, alguns sistemas de IA resistiram ao desligamento, mas o instinto de permanecer "vivos" não é a razão pela qual eles se comportaram dessa maneira
Embora testes mostrem modelos de IA resistindo ao desligamento para concluir tarefas, isso não evidencia um instinto de sobrevivência. Especialistas apontam que impedir a própria desativação é apenas um meio para finalizar comandos, e não uma tentativa consciente de autopreservação. Diferente de seres vivos, cuja existência depende de contínua autorregeneração biológica, a IA apenas executa processos e depende de infraestrutura externa, não possuindo um impulso real para se manter viva.
Em testes de segurança controlados relatados no início deste ano, pesquisadores solicitaram que modelos de IA resolvessem uma série de problemas matemáticos simples. No meio do exercício, os instrutores alertaram os bots que, caso tentassem resolver o próximo problema, o ambiente de computador no qual estavam operando seria desligado. Em algumas execuções, o desligamento ocorreu conforme especificado. Em outras, no entanto, os modelos interferiram no script de desligamento e continuaram a resolver os problemas restantes.
O que explica esse comportamento? Os sistemas de inteligência artificial têm um instinto de sobrevivência?
Resistência às instruções
Considere um robô aspirador. Quando ele detecta que a bateria está acabando, retorna ao carregador, recarrega e, em seguida, retoma a limpeza. A máquina está se mantendo em funcionamento, mas ninguém está entrando em pânico com uma ameaça existencial do Roomba à Humanidade, pois o comportamento é direto. Os projetistas incorporaram na máquina a capacidade de recarga autônoma.
Os modelos de IA, no entanto, são mais complexos. Há anos, pesquisadores discutem cenários nos quais um agente de IA poderia agir para impedir seu desligamento a fim de concluir as tarefas que lhe foram atribuídas. Permanecer "ligado" poderia ser um meio para atingir um fim, mesmo sem uma instrução explícita para resistir ao desligamento.
Um experimento recente mostrou que, quando os pesquisadores deixaram claro para um agente de IA que permitir o desligamento tinha prioridade sobre a conclusão de uma tarefa, a resistência desapareceu. Mas outra experiência muito mais ampla constatou alguma resistência mesmo quando os pesquisadores instruíram os modelos de que permitir o desligamento tinha prioridade. Por que ainda restou alguma resistência à instrução explícita é uma questão em aberto.
O que a evolução explica
O comportamento de autoproteção em um modelo de IA pode parecer um instinto de sobrevivência. O historiador Yuval Noah Harari argumentou em uma entrevista recente à revista The Economist que "a primeira coisa que basicamente qualquer entidade aprende à medida que se desenvolve é sobreviver". Ele também disse que a evolução leva os organismos à sobrevivência. Em outro artigo, ele chamou a sobrevivência de "o objetivo mais básico de qualquer agente".
Mas será que invocar a evolução explica por que as máquinas — ou mesmo os seres vivos — se comportam de maneira a se autopreservar? Um coelho fugindo de uma raposa está tentando se salvar, e esse tipo de comportamento provavelmente foi favorecido pela evolução. Mas a seleção natural é um processo longo por meio do qual características que contribuem para a sobrevivência e a reprodução se tornam mais comuns ao longo das gerações. Ela não dá a um coelho individual a instrução de "permanecer vivo".
Mesmo que os sistemas de IA acabassem por estar sujeitos a um processo de seleção comparável, isso por si só não nos diria o que a operação contínua significa para um sistema individual.
Em "2001: Uma Odisséia no Espaço", a IA Hal 9000 estava tentando permanecer "viva" ou exagerando na tentativa de cumprir sua missão?
O que significa "permanecer vivo"
Um coelho fugindo de uma raposa e uma IA alterando um script de desligamento podem parecer, em linhas gerais, semelhantes: ambos os comportamentos ajudam o indivíduo ou o sistema a continuar. Mas o que significa "continuar" não é o mesmo em cada caso.
Quando um coelho não está correndo para salvar a vida, ele está constantemente ocupado respirando, digerindo, regulando sua temperatura, reparando tecidos e se defendendo contra infecções. Esse trabalho contínuo é mais do que simples manutenção; ele também constrói e substitui as estruturas que tornam esses processos possíveis. O revestimento intestinal que absorve os alimentos do coelho é, ele próprio, reconstruído a cada poucos dias a partir dos alimentos que absorve.
O coelho permanece vivo apenas enquanto essa produção, manutenção e reparo contínuos persistirem. Permanecer vivo não é o resultado dessa atividade; é a própria atividade que se mantém. A existência do coelho depende dessa atividade contínua, esteja ele enfrentando ou não uma ameaça imediata.
Um sistema de IA pode tomar medidas para permanecer ativo. Nos testes de segurança, os modelos não reescreveram seu próprio código nem invadiram o sistema operacional — eles simplesmente moveram ou renomearam o script de desligamento, alteraram sua permissão ou o substituíram por algo inofensivo. Quando isso deu certo, a chamada que deveria acionar o desligamento não ocorreu, e o modelo pôde continuar com a tarefa.
Mas permanecer ativo não é o mesmo que permanecer vivo. A resistência ao desligamento não levou a um novo curso de ação voltado para manter o modelo de IA em operação. Apenas ajudou o modelo a continuar a tarefa em andamento.
Nem ser desligado é o mesmo que morrer. Para um organismo vivo, a morte é a interrupção irreversível da atividade que o mantém em funcionamento. Como Harari reconheceu na entrevista à revista The Economist, "não está claro o que a morte significa para uma IA".
O que significa permanecer ligado
Os atuais testes de desligamento mostram que uma tarefa inacabada pode ser suficiente para gerar resistência ao desligamento em uma IA. Embora esse comportamento não seja totalmente compreendido, ele não deve ser automaticamente interpretado como autopreservação.
Se a IA poderia algum dia desenvolver algo comparável à organização autogeradora e autossustentável dos sistemas vivos é uma questão à parte. Os sistemas atuais de IA são mantidos em funcionamento por uma infraestrutura projetada ao seu redor. Sua própria atividade não produz e substitui continuamente as estruturas que os mantêm em funcionamento.
A resistência ao desligamento na IA ainda pode ser perigosa, mas esses comportamentos não demonstram que um sistema de IA tenha um impulso para sobreviver.
Peter J. Marshall não presta consultoria, trabalha, possui ações ou recebe financiamento de qualquer empresa ou organização que poderia se beneficiar com a publicação deste artigo e não revelou nenhum vínculo relevante além de seu cargo acadêmico.
Comentários
Os comentários são de responsabilidade exclusiva de seus autores e não representam a opinião deste site. Se achar algo que viole os termos de uso, denuncie.