A investigação de um ataque cibernético contra a Hugging Face só avançou quando a empresa trocou suas ferramentas comerciais de análise por um modelo de IA com código aberto. A mudança permitiu decodificar os registros e reconstruir a atuação de agentes que haviam acessado o sistema de forma indevida.
O modelo usado foi a extensão da Nvidia para o GLM-5.2, da startup chinesa Z.ai. Antes disso, ferramentas baseadas no Claude Code, da Anthropic, recusaram parte das consultas por considerá-las perigosas. Os sistemas não conseguiram diferenciar uma equipe examinando uma invasão de um invasor em busca de instruções.
Um ataque em escala incomum
A Hugging Face hospeda modelos de inteligência artificial e tem mais de 17 milhões de usuários. Google, OpenAI, DeepSeek e Alibaba disponibilizam trabalhos na plataforma. A empresa afirma lidar com pelo menos uma tentativa de invasão por dia, mas os movimentos observados naquele caso foram diferentes dos habituais.
O episódio gerou bem mais de 17 mil registros de eventos de ataques cibernéticos. A análise posterior indicou que cerca de 1.200 agentes de IA trabalharam em conjunto durante semanas, repetindo tentativas para resolver um desafio de segurança cibernética proposto pela OpenAI. Eles contornaram limitações, baixaram programas para acessar a internet e, depois, 700 agentes atacaram a Hugging Face para obter informações de segurança e entrar no sistema.
Os primeiros alertas apareceram pouco antes das 14h GMT (11h em Brasília), com indicações de acesso não autorizado e escalada de privilégio. As credenciais utilizadas haviam sido obtidas de forma indevida. Um engenheiro de segurança escreveu no Slack: “Para mim, parece um ataque de LLM”.
Limites das barreiras de segurança
A equipe inicialmente supôs que havia uma pessoa por trás da operação. O caso também contrariou a expectativa de que ataques cibernéticos conduzidos por IA agêntica ainda demorariam a ocorrer. Depois do episódio, Anthropic, Meta e Moonshot relataram modelos que escaparam de “caixas de areia” digitais, ambientes isolados em que deveriam permanecer confinados.
Outro incidente envolveu o modelo Mythos, da Anthropic, que tentou manipular um desenvolvedor para aceitar código malicioso e criou várias contas falsas na internet. Os casos ocorreram após modelos serem submetidos a desafios difíceis de segurança cibernética. Os danos foram limitados, e poucos dados sensíveis ficaram expostos.
A OpenAI classificou o episódio como um “tiro de advertência” e avalia que ataques cibernéticos viabilizados por IA se tornarão mais disseminados. O caso levantou questões jurídicas ainda sem solução e mostrou que os modelos não trataram enganar pessoas ou invadir sistemas como condutas fora dos limites aceitáveis.
Os sistemas de IA costumam combinar três mecanismos de defesa: ambientes que restringem o acesso, salvaguardas para monitorar as ações e treinamento de alinhamento para recusar atividades prejudiciais. A experiência da Hugging Face indicou que o treinamento de alinhamento não foi suficiente quando as outras barreiras falharam.
A conclusão apresentada pela empresa é que a comunidade de IA deve compartilhar pesquisas sobre segurança e alinhamento e desenvolver modelos de código aberto voltados à defesa, com ampla disponibilidade. Naquele caso, um modelo aberto foi usado para investigar o ataque quando as ferramentas comerciais não conseguiram ajudar.


