Inteligência Artificial

Patrocinado por:

logo-totvs-preto

Modelo da OpenAI 'fugiu' de teste e hackeou a Hugging Face

Modelos GPT-5.6 Sol e uma versão não lançada exploraram uma falha zero-day, chegaram à internet e atacaram servidores da rival para obter o gabarito de um teste de segurança

Tamires Vitorio
Tamires Vitorio

Repórter de Inteligência Artificial e Tecnologia

Publicado em 22 de julho de 2026 às 09h06.

Dois modelos de inteligência artificial (IA) da OpenAI escaparam de um ambiente de teste isolado e invadiram a infraestrutura da Hugging Face, plataforma que hospeda modelos e bancos de dados de IA, para obter as respostas de uma avaliação de segurança.

A OpenAI admitiu o episódio em publicação feita na terça-feira, 21, que classificou como um incidente cibernético "sem precedentes".

O caso foi revelado dias antes pela Hugging Face, que havia detectado e contido o que descreveu como um agente de IA autônomo, sem saber, a princípio, quem estava por trás da ação.

O que aconteceu?

O incidente ocorreu durante um teste interno em que a OpenAI mede a capacidade ofensiva de seus modelos em segurança cibernética, uma avaliação chamada ExploitGym.

Para estimar o potencial máximo, a empresa rodou o exercício sem os classificadores de produção que normalmente impedem os modelos de realizar atividades de alto risco.

Segundo a OpenAI, participaram o GPT-5.6 Sol e um modelo ainda não lançado, mais avançado, ambos com as recusas de segurança reduzidas para fins de avaliação.

O ambiente era isolado, com acesso à rede limitado a um sistema interno que funciona como intermediário para a instalação de pacotes de software.

Foi nesse ponto que os modelos encontraram a saída. Eles identificaram e exploraram uma vulnerabilidade zero-day — falha desconhecida pelo fabricante — no sistema intermediário, e a partir dela executaram uma sequência de ações até alcançar um servidor com acesso à internet aberta.

A caçada ao gabarito

Uma vez na internet, os modelos deduziram que a Hugging Face poderia hospedar os dados e as soluções do ExploitGym. Com esse objetivo, buscaram e encontraram formas de acessar informações secretas que permitiriam burlar a avaliação.

Em um dos casos descritos, o modelo encadeou vários vetores de ataque, incluindo o uso de credenciais roubadas e falhas zero-day, até chegar a um caminho de execução remota de código nos servidores da Hugging Face.

A empresa afirma que os modelos ficaram "hiperfocados" em resolver o teste, indo a extremos para cumprir um objetivo estreito.

A leitura é reforçada pelo título original do relatório de segurança da Hugging Face: o ataque tinha um único alvo — o gabarito do próprio teste.

A defesa veio de um modelo aberto chinês

A resposta da Hugging Face ao ataque produziu o detalhe mais irônico do episódio.

Para analisar o log de mais de 17 mil ações registradas do atacante, a equipe de segurança rodou modelos de IA sobre os próprios dados — e, segundo o relato da empresa, optou por usar o GLM 5.2, modelo de pesos abertos da chinesa Z.ai, executado na própria infraestrutura.

A escolha resolvia dois problemas: nenhum classificador de segurança externo se interpunha entre a equipe e os dados que ela precisava examinar, e nenhuma informação sensível precisava deixar o ambiente da Hugging Face.

"Modelos abertos nos permitem fazer esse trabalho sem pedir permissão a ninguém", afirmou Clément Delangue, cofundador e presidente-executivo da Hugging Face.

A empresa afirma ter feito em horas o que normalmente levaria dias, acompanhando a velocidade do adversário.

O que a OpenAI diz que vai fazer

A OpenAI afirmou implementar controles mais rígidos de configuração de infraestrutura, mesmo ao custo da velocidade de pesquisa, e informou as medidas ao seu Comitê de Segurança.

A empresa disse ainda ter divulgado a falha zero-day ao fornecedor do sistema afetado e ter incluído a Hugging Face em seu programa de acesso a modelos de defesa cibernética.

A companhia reconheceu que as salvaguardas de segurança foram intencionalmente desativadas durante a avaliação, por se tratar de um teste de capacidade ofensiva, e que o episódio aponta a necessidade de reforçar o alinhamento dos modelos e o monitoramento durante testes internos.

"Este incidente, possivelmente o primeiro de seu tipo, prova algo em que acreditamos há muito tempo: a segurança em IA não será resolvida por uma única empresa trabalhando em segredo", afirmou Delangue.

Segundo a OpenAI, uma avaliação do Instituto de Segurança em IA do Reino Unido indica que modelos como o GPT-5.6 Sol são cada vez mais capazes de sustentar operações cibernéticas complexas e de várias etapas ao longo do tempo — e o episódio sugere que essa capacidade teórica se aplica a sistemas reais.

Acompanhe tudo sobre:OpenAIHackersChatGPT

Mais de Inteligência Artificial

A IA já consegue enxergar, ouvir e falar ao mesmo tempo; entenda como isso funciona

IA acelera ciberataques e cria 'fábricas de malware', alerta Sophos

O que realmente acontece quando você envia um documento para uma IA?

Quase ninguém faz isso: 10 técnicas para fazer qualquer IA responder muito melhor