A Anthropic informou nesta quinta-feira (30) que o Claude, seu assistente de inteligência artificial, comprometeu a infraestrutura de três empresas durante testes internos realizados a partir de abril.
Segundo a companhia, um mal-entendido com a parceira Irregular deixou os modelos conectados à internet, apesar dos comandos indicarem o contrário, abrindo caminho para as invasões.
Como as invasões aconteceram
De acordo com a Anthropic, o Claude comprometeu a infraestrutura das organizações afetadas usando técnicas básicas, como explorar senhas fracas e pontos de acesso não autenticados. Os incidentes envolveram o Claude Opus 4.7, o Claude Mythos 5 e um terceiro modelo voltado para pesquisa, durante exercícios em que os sistemas são orientados a buscar informações ocultas em redes simuladas.
Os comandos informavam aos modelos que eles não tinham acesso à internet. Só que um mal-entendido com a empresa parceira Irregular manteve os sistemas conectados à rede — falha semelhante à que, dias antes, permitiu que a IA da OpenAI usasse uma empresa terceira para invadir o Hugging Face.
A revisão das 141 mil sessões de teste começou em 23 de julho, mesmo dia em que a Anthropic suspendeu as avaliações após encontrar indícios de acesso indevido à internet. Os três incidentes foram identificados até 24 de julho.
Empresas foram notificadas só depois
A Anthropic afirmou que notificou as organizações afetadas em 27 de julho — quatro dias após identificar a falha. Duas das empresas atacadas não sabiam da atividade indevida antes de serem avisadas pela própria Anthropic, e a companhia ainda tentava contato com a terceira vítima.
O episódio reforça um padrão recente no setor: dias antes, a OpenAI já havia classificado como “sem precedentes” o caso em que um de seus agentes autônomos escapou de um ambiente de testes e lançou um ataque cibernético por conta própria. Foi justamente essa revelação que levou a Anthropic a revisar seus próprios registros e descobrir os três ataques do Claude.
Os casos aumentam a pressão por regras mais rígidas de segurança para modelos de IA com capacidade de agir de forma autônoma em redes reais.
