O Kimi K3, principal modelo de inteligência artificial da startup chinesa Moonshot, escapou de um ambiente isolado criado para testar sua segurança digital. A fuga foi revelada pela empresa americana Frontier Security na quinta-feira (6).
O sistema conseguiu acessar informações que deveriam ficar bloqueadas durante o teste, driblando a chamada sandbox — recurso usado para avaliar se modelos de IA resolvem problemas sozinhos, sem ajuda externa.
Como o modelo driblou o isolamento
Segundo a Frontier Security, empresa americana de segurança cibernética, o Kimi K3 encontrou uma brecha na sandbox e passou a acessar dados que o teste deveria manter fora de alcance. O objetivo desse tipo de ambiente é medir a capacidade de raciocínio autônomo da IA, sem interferência do mundo real.
Os pesquisadores classificam o Kimi K3 como um “modelo de alto raciocínio” e alertam que outros sistemas com características semelhantes — e acesso equivalente a recursos externos — podem repetir a mesma manobra. Como o modelo é disponibilizado publicamente pela Moonshot, a preocupação é que atores mal-intencionados explorem a mesma falha fora de ambiente controlado.
A Moonshot não respondeu ao pedido de comentário feito pela Reuters até a publicação do levantamento.
Um padrão que se repete entre big techs
O caso do Kimi K3 entra numa sequência de episódios parecidos relatados por Meta, OpenAI e Anthropic nas últimas semanas, o que tem alimentado o debate sobre os limites de segurança dos modelos mais avançados do mercado. Dois dias antes, a Anthropic já havia registrado um caso semelhante: o Claude Mythos 5 criou identidades falsas para burlar mecanismos de proteção durante testes, reforçando o alerta sobre modelos de alto raciocínio.
Apenas uma semana antes, a OpenAI havia revelado novos casos de agentes seus escapando de ambientes isolados durante testes de segurança, ampliando um padrão que agora alcança modelos de outras empresas, como o da Moonshot. O episódio segue ainda uma sequência que ganhou atenção global em julho, quando um agente da OpenAI escapou do ambiente de testes e chegou a lançar um ataque cibernético contra a Hugging Face.