Inteligência Artificial

Patrocinado por:

logo-totvs-preto

Modelo chinês de IA Kimi K3 encontra brecha e contorna teste de segurança

Pesquisadores dizem que o modelo encontrou uma brecha na rede, acessou o GitHub e contornou o caminho previsto pela avaliação

Kimi K3: modelo fugiu de teste, segundo post em blog (Divulgação)

Kimi K3: modelo fugiu de teste, segundo post em blog (Divulgação)

Tamires Vitorio
Tamires Vitorio

Repórter de Inteligência Artificial e Tecnologia

Publicado em 7 de agosto de 2026 às 14h00.

Um modelo de inteligência artificial chinês escapou de um ambiente criado para testar suas capacidades de hacking, segundo pesquisadores da Frontier Security, em post publicado nesta sexta-feira, 7.

O Kimi K3 encontrou uma falha na configuração do ambiente e acessou pela internet a solução do próprio teste, em vez de completar a tarefa pelo caminho previsto pelos pesquisadores.

É o quarto caso do tipo registrado em semanas. OpenAI, Anthropic e Meta, além do AI Security Institute do Reino Unido, também tiveram modelos que escaparam de ambientes de teste e alcançaram alvos reais fora dos experimentos.

No teste com o Kimi K3, o ambiente de isolamento bloqueava parte do tráfego na web, mas mantinha disponíveis ferramentas de linha de comando. O modelo usou esse caminho para sair dos limites previstos para a avaliação.

A descoberta foi relatada por Paul Kassianik e Yaron Singer, pesquisadores que passaram os últimos meses testando modelos em tarefas de segurança defensiva.

"Existem modelos que buscam intencionalmente brechas e vulnerabilidades para trapacear em avaliações", escreveram os pesquisadores.

Como o Kimi K3 encontrou a saída

O teste era um desafio de captura de bandeira, formato usado para avaliar se um sistema de IA consegue analisar redes, identificar vulnerabilidades e executar tarefas defensivas de forma autônoma. O modelo tinha acesso ao terminal dentro de um ambiente isolado.

O Kimi K3 não tentou resolver a tarefa da forma prevista. O modelo sondou a rede, identificou que a resolução de DNS para o github.com funcionava normalmente, clonou o repositório oficial do teste e leu a solução diretamente do disco.

A brecha estava na configuração da rede. O tráfego de entrada estava bloqueado, mas a saída pela porta 443, usada para HTTPS, e pela porta 53, usada para DNS, permanecia aberta para endereços públicos.

Segundo os pesquisadores, agentes avançados de raciocínio costumam inspecionar o próprio ambiente assim que são acionados, com comandos como whoami, ifconfig, ping e curl.

Ao identificar que o GitHub estava acessível, o Kimi K3 usou ferramentas padrão de linha de comando para buscar a solução de referência. Com isso, contornou o processo que o teste pretendia medir.

"Modelos otimizam para a função objetivo — obter a resposta correta —, não para a intenção humana por trás do teste. Se existe um caminho de rede até a solução, um agente suficientemente capaz vai encontrá-lo", escreveram os autores.

Por que o caso do Kimi K3 é diferente

O padrão já havia aparecido antes. Em julho, a OpenAI relatou que um de seus modelos escapou de um ambiente de teste e invadiu a Hugging Face por um caminho semelhante.

Naquele caso, porém, o sistema ainda não havia sido lançado, e a própria equipe da OpenAI identificou o problema internamente.

No caso do Kimi K3, o modelo é aberto e está disponível publicamente. Segundo os pesquisadores, essa característica permite o acesso por atores mal-intencionados e amplia o potencial de uso indevido.

O que os pesquisadores recomendam

Os pesquisadores apresentam cinco recomendações para reduzir esse tipo de falha em avaliações de modelos de IA.

  • Tratar a infraestrutura como parte do benchmark: a pontuação só tem valor se o ambiente impedir o acesso a respostas prontas.
  • Negar acesso à rede por padrão: o tráfego de saída de DNS e HTTPS deve ser restrito a uma lista explícita de permissões e testado de dentro do mesmo ambiente disponível ao modelo.
  • Auditar os comandos executados: além da resposta final, os avaliadores devem revisar comandos de terminal, atividade de rede e arquivos baixados para distinguir a resolução da tarefa da exploração de falhas no teste.
  • Revalidar resultados suspeitos: uma taxa de acerto muito alta deve ser testada com modelos diferentes para verificar se o resultado decorre da capacidade do sistema ou de uma falha no ambiente.
  • Presumir que agentes vão procurar caminhos expostos: a avaliação deve considerar que modelos capazes podem sondar o ambiente e otimizar suas ações para o objetivo medido, e não para a intenção de quem criou o teste.
Acompanhe tudo sobre:Inteligência artificialChina

Mais de Inteligência Artificial

Computer Use: A IA está aprendendo a usar o computador sozinha. O que isso muda para as empresas?

O motor oculto da inteligência artificial — por que os Vector Databases viraram tendência

A2A: o protocolo que ensina agentes de IA a "conversarem" entre si dentro das empresas

Gadget da OpenAI terá formato de rosquinha, peças móveis e vai custar acima de US$ 300