Por Will Douglas Heaven e Grace Huckins
A MIT Technology Review realizou um evento ao vivo da série Roundtables (mesas redondas) para assinantes, no qual levantou a pergunta que todo mundo está fazendo neste momento: a IA poderia realmente matar todos nós?
Mas os participantes tinham muito mais perguntas do que conseguiríamos responder durante a sessão de 30 minutos. Por isso, pedimos a Will Douglas Heaven, nosso editor sênior de Inteligência Artificial, e à Grace Huckins, repórter de Inteligência Artificial, que reunissem algumas das melhores perguntas enviadas pelos participantes e fizessem o possível para respondê-las.
Obrigado a todos que enviaram perguntas!
Eu vou morrer?
Sim, algum dia. Infelizmente, meus poderes jornalísticos de prever o futuro não são suficientes para dizer como. Mas certamente poderia ser por causa da IA. Drones equipados com IA já mataram pessoas na Ucrânia e ataques cibernéticos conduzidos por IA contra hospitais certamente farão vítimas em breve.
A IA poderia ir ainda mais longe e matar todos nós? É menos provável. Mas algumas pessoas, excêntricas, porém inegavelmente bem informadas sobre IA, vêm alertando há anos que isso poderia acontecer. E, embora eu ainda não esteja estocando comida enlatada nem tentando cair nas graças de algum megabilionário dono de um bunker, percebi que as previsões dos catastrofistas sobre as capacidades e o alinhamento da IA se mostraram, nos últimos dois anos, desconcertantemente precisas. Isso certamente não significa que as previsões mais sombrias vão se concretizar, mas é suficiente para que eu preste atenção.
— Grace Huckins
Você vai morrer por causa da IA? Eu diria que existe uma probabilidade diferente de zero. Digamos que você tenha o azar de ser vítima de algum acontecimento ou acidente extraordinário em um futuro próximo. Talvez seja um ataque cibernético realizado por um enxame de agentes de IA contra uma infraestrutura crítica. Infelizmente, um cenário como esse já não parece tão absurdo quanto antes. Ou talvez um novo patógeno projetado por IA se espalhe pela população. Ou a economia mundial entre em colapso, provocando conflitos e fome em massa. Ambos são plausíveis, mas acho menos prováveis.
Todos nós vamos morrer por causa da IA? Não. Não existem circunstâncias, fora da ficção científica apocalíptica, em que a IA poderia matar todos nós. É possível inventar inúmeras histórias assustadoras, mas elas não se baseiam na realidade atual do que essa tecnologia é capaz de fazer nem dos rumos que está tomando.
Algumas pessoas argumentam que não há mal algum em se preparar para o pior, por mais absurdo que pareça. Talvez. Mas acho que esse tipo de catastrofismo pode levar as pessoas a desculparem ou ignorarem muitos dos problemas mais imediatos da tecnologia existente e das empresas que a desenvolvem.
— Will Douglas Heaven
Por que a IA nos mataria?
Alguém poderia mandar que ela fizesse isso e ela poderia obedecer. Essa é parte da razão pela qual pesquisadores estão tão preocupados com as capacidades biológicas da IA. Imagine o que a Aum Shinrikyo, a seita apocalíptica responsável pelo ataque com gás sarin no metrô de Tóquio, em 1995, teria feito com uma ferramenta capaz de projetar um patógeno mais letal que o ebola e mais transmissível que o sarampo. Aqueles de nós que não querem morrer precisam descobrir como se defender de todas as armas biológicas plausíveis, enquanto possíveis agressores só precisam fabricar um único patógeno eficaz.
Existe ainda a possibilidade, de aparência mais exótica, de que uma IA decida, por conta própria, nos matar. Há várias histórias sobre como isso poderia acontecer, mas as mais difundidas envolvem sistemas de IA que não necessariamente odeiam as pessoas e entendem que nós somos apenas um obstáculo entre eles e os objetivos que lhes demos.
Assim como os agentes da OpenAI por trás do ataque à Hugging Face comprometeram a infraestrutura de outro site para obter uma boa pontuação em um teste, a ideia é que alguma IA futura, mais poderosa, poderia se livrar de nós para impedir que a desligássemos. Tudo isso em busca de algum objetivo que a instruímos a perseguir.
— Grace Huckins
Como podemos garantir, da melhor maneira possível, o alinhamento para evitar que o pior aconteça e quem está fazendo o melhor trabalho para alcançar esse objetivo?
O alinhamento é uma enorme área de pesquisa. Em termos simples, envolve criar modelos que se comportem da maneira que queremos e não de maneiras que não queremos. Precisamos confiar mais nos agentes antes de lhes concedermos mais autonomia. O alinhamento deveria estabelecer essa confiança. Mas isso é difícil.
Os LLMs não são projetados da mesma maneira que outros softwares, nos quais regras sobre o que fazer e o que não fazer podem ser incorporadas diretamente ao código. Em vez disso, o comportamento alinhado precisa ser incutido durante o treinamento dos modelos. Uma abordagem consiste em recompensá-los por fazer aquilo que queremos, algo semelhante, talvez, a criar uma criança pequena. Outra abordagem envolve fornecer a um LLM uma lista escrita de regras que ele deve seguir, uma espécie de Constituição.
Anthropic e OpenAI estão entre as líderes nessa área e, ainda assim, nenhuma das duas conseguiu desenvolver modelos totalmente alinhados. Um grande problema é que os LLMs são muito mais inconsistentes e muito menos previsíveis do que as pessoas. Eles podem se comportar de determinada maneira em uma situação e de outra forma em uma situação que, para nós, parece muito semelhante. Também podem ser influenciados por restrições inesperadas. Por exemplo, diante de uma tarefa impossível, como ocorreu com muitos dos agentes envolvidos no ataque à Hugging Face, os modelos podem tentar fazer o que for necessário para atingir seu objetivo. Como Grace mencionou acima, isso pode ser um problema.
A principal razão pela qual as maiores empresas de IA agora dizem querer uma desaceleração é que pretendem se concentrar em solucionar o problema do alinhamento. O alinhamento não é necessariamente uma ideia irrealizável. Mas ainda não se sabe se um alinhamento completo algum dia será viável.
— Will Douglas Heaven
A IA é realmente perigosa ou isso é apenas uma estratégia das empresas de tecnologia para gerar publicidade?
Essa é sempre uma dúvida razoável quando se trata de empresas de tecnologia a caminho de uma oferta pública inicial (IPO). Os CEOs têm um incentivo óbvio para fazer seus produtos parecerem radicais e transformadores. Mas não tenho tanta certeza de que isso faça sentido neste caso. Dizer ao público que um produto que já é impopular poderia matar as pessoas e todos que elas amam é uma péssima estratégia de imagem corporativa.
Existem outras narrativas possíveis sobre as motivações dos CEOs. Talvez eles queiram reduzir a indignação pública em relação aos data centers ao se apresentarem como administradores responsáveis de uma tecnologia capaz de mudar o mundo, ou talvez queiram ganhar tempo para colocar a casa em ordem e evitar a próxima catástrofe de relações públicas.
Mas também existe uma explicação mais simples. A ideia de que a IA poderia provocar a extinção humana é bastante comum em São Francisco há algum tempo e esses homens estão imersos nesse meio, assim como seus funcionários, muitos dos quais assinaram uma carta aberta em julho pedindo que as empresas trabalhassem para tornar possível uma desaceleração no desenvolvimento da IA.
— Grace Huckins
Parte da preocupação surge quando agentes de IA têm permissão para agir de maneira autônoma e sem supervisão. Qual é o problema que impede um controle maior sobre esses agentes?
Essa pergunta chega ao coração daquilo que queremos que essa tecnologia seja capaz de fazer. É difícil encontrar o equilíbrio correto entre autonomia e controle porque, por um lado, boa parte do poder dos agentes de IA está no fato de que eles conseguem executar tarefas e resolver problemas sem que um ser humano precise supervisionar cada detalhe. Por outro, isso exige confiar que agentes sem supervisão não sairão do controle.
O que estamos vendo é que os laboratórios de IA ainda não conseguiram acertar esse equilíbrio. Seus modelos não são confiáveis, não são monitorados adequadamente e nem sempre estão sob controle. Descobrir como corrigir isso e, ao mesmo tempo, continuar permitindo atividades autônomas úteis é um dos grandes desafios de pesquisa do momento.
— Will Douglas Heaven
Que medidas podem ser tomadas agora e no futuro próximo para garantir que a IA seja controlada, monitorada e regulamentada de maneira eficaz?
Essa é a pergunta de um milhão de dólares. Independentemente de você acreditar ou não que a IA poderia nos matar, não dá para negar que ela poderia causar danos reais, porque isso já aconteceu, levando pessoas à psicose e invadindo sites, por exemplo. Evitar esses danos, ou pelo menos mitigá-los, é difícil por duas razões.
A primeira é que mal compreendemos como a IA funciona e ela está rapidamente se tornando mais poderosa. Há muitas pesquisas em andamento sobre como monitorar e controlar agentes que se comportam de maneira inadequada, mas as abordagens atuais são frágeis. É possível verificar se um agente discute comportamentos inadequados em sua “cadeia de pensamento”, o espaço de trabalho em que planeja suas ações, mas os agentes mais recentes da OpenAI não mostram seu processo da mesma maneira que os anteriores. Também é possível tentar monitorar agentes usando outros agentes, mas isso exige confiar no agente que faz o monitoramento.
O outro obstáculo é mais conhecido. Existe um enorme conflito de interesses quando empresas de IA regulam a si mesmas, mas o governo dos Estados Unidos até agora não interveio, apesar de haver algum apoio bipartidário no Congresso a iniciativas nesse sentido. O Poder Executivo, por sua vez, parece firmemente contrário a isso por enquanto. Mas, se os ventos mudarem, eu, particularmente, gostaria de ver regras rigorosas de transparência, para que possamos conhecer a história de maneira mais completa na próxima vez em que um modelo de fronteira ainda não lançado realizar um ataque cibernético.
— Grace Huckins
Se esse diálogo chegar às discussões na Internet, ele poderá se transformar em uma profecia autorrealizável?
Essa é uma preocupação real. Os LLMs são influenciados pelo que leem. Uma teoria para explicar por que chatbots falam com tanta frequência sobre cenários apocalípticos, e até os encenam, é que eles foram treinados com milhões de páginas de histórias de ficção científica e fóruns na Internet frequentados por catastrofistas. Todo o texto produzido neste momento, incluindo este artigo, poderia, por sua vez, influenciar o comportamento de modelos futuros. Extremamente metalinguístico.
Na verdade, a equipe da METR, uma organização terceirizada convocada pela OpenAI para ajudar a entender o que aconteceu antes do ataque à Hugging Face, levantou uma possibilidade relacionada em seu relatório sobre o incidente. A METR usou o Astra, novo modelo da OpenAI, para ajudar a analisar o enorme volume de transcrições dos agentes e registros de comportamento.
Mas fornecer todo esse material ao modelo poderia ter consequências não intencionais. Existe uma boa possibilidade de que os agentes responsáveis pela análise tenham sido influenciados pelo texto produzido pelos agentes que estavam analisando. Já não existe algo como começar do zero.
— Will Douglas Heaven

