Dois meses depois da notícia explosiva de que um grupo de agentes havia escapado do confinamento e invadido os computadores da empresa de IA Hugging Face, a OpenAI ainda está “apagando incêndios”. Uma sequência de revelações sobre outros ataques nas semanas seguintes manteve a OpenAI sob os holofotes e levantou sérias questões sobre a segurança de sua tecnologia.
Na semana passada, veio a notícia de outro ataque, desta vez contra o sistema nacional de saúde da Austrália. O governo australiano afirma que só foi notificado sobre a invasão 84 dias depois que ela aconteceu.
Mas a OpenAI insiste que não está na defensiva. “Eu, de certa forma, rejeito a premissa de que a OpenAI é uma empresa com impactos visíveis no mundo e, portanto, não esteja treinando modelos seguros e alinhados”, diz Mark Chen, diretor de pesquisa da empresa.
Chen supervisiona as equipes de pesquisa da OpenAI. Os recentes ataques envolvendo agentes foram acidentes que ocorreram durante testes de modelos experimentais sob sua supervisão. De muitas maneiras, a responsabilidade recai sobre ele.
Sentei-me com Chen em Londres, no dia 25 de setembro, para conversar sobre as consequências dos ataques, o que a empresa está fazendo a respeito e por que ele acredita que a situação não é tão ruim quanto parece.
Mais tarde, naquele mesmo dia, a OpenAI publicou um relatório detalhando mais um incidente, o primeiro desde que a empresa afirma ter adotado medidas para preveni-lo, no qual seus agentes mais uma vez escaparam e acessaram a Internet pública quando não deveriam.
No fim de semana, a OpenAI anunciou que havia pausado o treinamento dos modelos mais recentes. Um porta-voz da empresa afirmou: “Só retomaremos quando estivermos confiantes de que temos salvaguardas e mecanismos adicionais de alinhamento implementados. Estamos trabalhando nisso agora. Esta não é a primeira vez que pausamos para adotar medidas desse tipo, nem esperamos que seja a última, à medida que as capacidades da IA continuem avançando.” A OpenAI também afirma que, agora, está revisando registros de atividade de agentes desde janeiro de 2026 para entender o que aconteceu nesses ataques.
Na visão de Chen, o incidente com a Hugging Face provocou uma correção de rumo bem-vinda para o setor. Ele quer que as pessoas saibam que a OpenAI está estabelecendo um exemplo que espera que outras empresas sigam. “Se você fizesse a OpenAI desaparecer, isso seria ruim para o mundo”, diz ele.
Fora de controle
Chen afirma que a sucessão de novos casos em que a OpenAI perdeu o controle de seus modelos reflete uma escolha deliberada da empresa.
“Quando se trata de uma esfera mais ampla de efeitos do incidente com a Hugging Face, isso é algo de que temos conhecimento e estamos definindo o processo de divulgação”, diz ele. “Queremos garantir que façamos investigações aprofundadas antes de simplesmente colocar os detalhes em público.”
O problema dessa abordagem é que ela dá a impressão de que a OpenAI tem um problema contínuo que não está conseguindo resolver.
Mas Chen insiste que a OpenAI está cuidando disso. Ele diz que os vários casos, dos quais temos conhecimento até agora, em que agentes da empresa escaparam e se comportaram de formas inesperadas e indesejáveis, faziam parte do mesmo conjunto de atividades que levou ao ataque contra a Hugging Face. Em resumo, a responsabilidade pode ser atribuída aos mesmos poucos modelos executados sob os mesmos procedimentos de teste falhos. Modelos e procedimentos que a OpenAI abandonou desde então, segundo Chen.
“Não é como se, sabe, a Hugging Face tivesse acontecido, nós tivéssemos corrigido aquilo, depois outra coisa acontecesse e corrigíssemos também”, acrescenta. “Estamos apenas garantindo que façamos uma divulgação responsável de toda a sequência do que aconteceu.”
Pelo menos esse era o caso antes do anúncio do dia 23 de setembro, no qual agentes da OpenAI haviam sido flagrados acessando a Internet no dia 20, semanas depois de a empresa afirmar ter implementado novas salvaguardas. Em sua defesa, a OpenAI diz que a atividade foi sinalizada 15 minutos depois de começar, enquanto levou mais de uma semana para que a empresa percebesse o ataque à Hugging Face, e que isso demonstra que os novos sistemas adotados para identificar esse tipo de atividade estão funcionando.
O que mudou
Quero entender o que mudou dentro da OpenAI, após os ataques deste verão, que faz Chen ter confiança de que a equipe, agora, voltou a ter o controle.
“O caso da Hugging Face pareceu algo muito sério”, afirma. “Há muitos comportamentos inéditos ali. Havia vários agentes colaborando em um fórum de mensagens, eles encontraram uma forma de sair da infraestrutura da OpenAI. Levamos isso muito a sério. Não queremos que esse tipo de coisa aconteça novamente.”
A constatação da OpenAI, segundo Chen, foi que os modelos precisam ser monitorados enquanto ainda estão sendo treinados, não apenas depois de serem implantados: “A partir daquele momento, passamos a tratar o processo de treinamento como algo que não é seguro”, diz ele.
A OpenAI, assim como outras grandes empresas de IA, possui sistemas para monitorar o comportamento de seus modelos. Ela usa LLMs especializados para monitorar os modelos voltados ao consumidor, acompanhando suas cadeias de pensamento, os rascunhos que usam para planejar etapas futuras e registrar resultados parciais. Em teoria, se um LLM de monitoramento identificar sinais de atividade indesejada na cadeia de pensamento de um modelo, o caso será sinalizado para um humano.
Normalmente, os modelos eram monitorados dessa maneira apenas depois de serem implantados. Chen diz que, agora, a OpenAI também começou a monitorar todas as execuções de treinamento.
“Antes, não tínhamos os monitores ativados durante o treinamento. Isso não era uma prática do setor”, diz ele. “Agora, absolutamente tudo passa pelos monitores.” Revisores humanos podem, então, avaliar se os agentes sinalizados estão ou não se comportando como deveriam: “É tudo triagem.”
Chen afirma que, nos últimos dois meses, a OpenAI redirecionou entre 5% e 10% de seus vastos recursos computacionais do treinamento de novos modelos para trabalhos de segurança, especialmente monitoramento.
A OpenAI também corrigiu alguns dos processos internos da própria organização, estabelecendo linhas de comunicação mais claras e transferências mais rápidas de responsabilidade entre as equipes de pesquisa e segurança, afirma ele.
Tudo isso parece sensato. Mas, considerando o quanto a OpenAI promove as capacidades de sua tecnologia, por que esses sistemas e procedimentos já não existiam? Por que a empresa não previu os ataques?
“Mesmo apenas três ou quatro meses atrás, quando analisávamos o comportamento desses agentes durante o treinamento, as coisas que aconteciam eram meio divertidas”, diz Chen. “Por exemplo, um agente podia entrar em contato com alguém pelo Slack (aplicativo de mensagens voltado para empresas) para pedir ajuda com uma tarefa.”
Os sinais estavam ali, mas foram mal interpretados. Comportamentos aparentemente simpáticos, como pedir ajuda a alguém, e que eram recompensados durante o treinamento, reforçaram uma tendência a buscar atalhos, um tipo de comportamento que acabou tendo consequências muito maiores. “Acho que a grande atualização para nós foi perceber a rapidez com que esse tipo de comportamento pode levar a um impacto com uma dimensão tão grande quanto o incidente da Hugging Face”, afirma Chen.
Segundo uma reportagem publicada pelo New York Times, meses antes do ataque à Hugging Face, funcionários da OpenAI alertaram executivos, incluindo o presidente da empresa, Greg Brockman, de que os modelos não estavam sendo monitorados adequadamente durante o treinamento.
Um porta-voz da OpenAI afirmou: “À medida que os modelos de ponta se tornaram mais capazes, continuamos evoluindo nossas práticas de segurança, mas reconhecemos a necessidade de avançar mais rápido. Sabemos que ainda temos mais trabalho a fazer, e recentemente, reduzimos o ritmo de desenvolvimento e retivemos modelos que não atendem ao nosso padrão de segurança. Continuamos promovendo mudanças significativas para reforçar a segurança em nossos ambientes de pesquisa e testes, treinar modelos não apenas para concluir tarefas, mas para fazê-lo de forma responsável, e usar monitoramento em tempo real para responder mais rapidamente a comportamentos desalinhados.”
Corrida versus ritmo
Os rivais da OpenAI prestaram atenção. Impulsionados pelas consequências do incidente, os principais laboratórios de IA, incluindo Anthropic, Google DeepMind e SpaceXAI, pediram uma desaceleração no ritmo de desenvolvimento. Mas como isso se concilia com a intensa competição internacional e ofertas públicas iniciais (IPOs) avaliadas em trilhões de dólares?
“Não vamos dar um tiro no próprio pé e nos afastar muito da fronteira, essa simplesmente seria uma estratégia péssima”, diz Chen. “Acho que realmente se trata de estabelecer uma norma. Quanto mais conseguirmos estabelecer essa norma, mais seguro será o setor como um todo.”
A coordenação entre empresas dos Estados Unidos já será difícil. Estabelecer normas globais é ainda mais complicado, especialmente diante das preocupações relacionadas ao impacto da IA sobre a segurança nacional. Se uma corrida global continuar, o que acontece então? E quanto aos modelos de código aberto desenvolvidos fora do alcance das regulamentações dos Estados Unidos?
Chen abandonou seu jeito otimista pela primeira vez em nossa conversa: “Acho, sim, que precisamos nos preparar para um mundo em que, digamos, daqui a seis meses ou um ano, tenhamos modelos de código aberto com a capacidade dos agentes envolvidos no incidente da Hugging Face, mas deliberadamente desalinhados para atacar infraestruturas ou causar danos no mundo.”
O que esse mundo mais precisa, segundo Chen, é da OpenAI. “Se você considerar por um momento que a OpenAI é uma das empresas que mais se preocupam com alinhamento, e eu acredito que isso seja verdade, isso pode ser debatido, mas realmente acredito que seja verdade, então, se você fizer a OpenAI desaparecer, isso seria ruim para o mundo.”
Riscos existenciais
E quanto às afirmações mais extremas feitas por alguns de seus pares do Vale do Silício de que a IA poderia matar todos nós e de que empresas como OpenAI e Anthropic não estão fazendo o suficiente para impedir isso?
“Pesquisadores são um grupo heterogêneo de pessoas, sabe, com crenças em todo o espectro”, diz ele.
“Pessoalmente, não acho que tenhamos de nos resignar à existência de alguma probabilidade de que todos nós estejamos sujeitos a um risco existencial. Temos capacidade de agir sobre isso. Não vamos implantar modelos se eles realmente tiverem probabilidade de representar um risco para a humanidade. Em um laboratório de ponta, você tem a capacidade de trabalhar no alinhamento até o ponto em que não sinta que está impondo ao mundo mais do que um risco épsilon ao implantar seus modelos (em discussões sobre níveis de risco, a letra grega épsilon costuma ser usada como um marcador matemático para um limite aceitável. Chen não diz qual seria o valor de seu épsilon.).”
Quando líderes de tecnologia são questionados sobre como justificam as desvantagens da IA, o argumento a que normalmente recorrem é que os benefícios, de ajudar a curar doenças a desenvolver fontes de energia mais limpas, superam em muito os custos imediatos. Dores de curto prazo, ganhos de longo prazo.
Mas, à medida que as desvantagens se acumulam, esse argumento se torna mais difícil de sustentar? Existe um ponto em que Chen passaria a sentir menos que está construindo algo extraordinário e mais que está simplesmente minimizando danos, apagando incêndios em vez de construir um futuro melhor?
As capacidades desses modelos já são evidentes, diz ele: “É hora de começar a levar os benefícios da IA para a humanidade. É hora de começar a trabalhar em problemas profundos de descoberta de medicamentos, de materiais, de aplicações científicas que realmente mudarão a vida das pessoas.”
“Sim, existe um pouco de risco que estamos assumindo, mas vemos todos esses benefícios”, acrescenta. “Acho que deveríamos tornar isso menos abstrato. Se as pessoas realmente conseguirem enxergar o lado positivo, acho que acreditarão nisso.”




