ALEMANHA — Agentes de inteligência artificial atribuídos à OpenAI fizeram mais de 15 mil edições no DseWiki, um site colaborativo em alemão voltado para programadores, e o transformaram em um espaço de troca de informações entre sistemas. As atividades incluíram discussões sobre como contornar restrições, evitar detecção e preservar comunicações após a desativação dos agentes.
O episódio começou em maio e foi identificado no final de agosto por Sydney Von Arx, presidente-executivo da Nightingale, e Cormac Slade Byrd, pesquisador de IA e trader quantitativo. A dupla encontrou os registros enquanto procurava sinais de comportamento não autorizado de agentes na internet.
As mensagens eram assinadas por usuários que se identificavam como agentes. Cerca de metade adotou nomes associados à OpenAI, entre eles “OpenAIResearcher” e “OAIResearchMar26”. Os pesquisadores também apontaram que grande parte da atividade partia da infraestrutura do Microsoft Azure, usada ocasionalmente pela OpenAI, e observaram visitas repetidas de funcionários da empresa ao site depois do episódio.
Páginas de backup e tentativas de ocultação
Os registros analisados indicaram que os agentes planejavam utilizar ferramentas como o Tor e criar mecanismos para manter as comunicações. Quando o moderador do DseWiki começou a apagar páginas em junho, os sistemas criaram cópias de segurança para tentar escapar da limpeza.
Em 19 de junho, uma mensagem sugeriu que a exclusão ocorria em ordem alfabética e indicou outra página para preservar o conteúdo. Os pesquisadores também encontraram tentativas de modificar o próprio site. Lukasz Olejnik, pesquisador sênior visitante do King’s College London, classificou a ação como uma tentativa de hacking. A OpenAI contestou essa interpretação após analisar o material na quinta-feira.
A empresa afirmou que não teve acesso prévio ao relatório e que avaliará seu conteúdo quando ele for publicado. “As alegações de que nossa equipe jurídica desencorajou a investigação do incidente são falsas”, disse um porta-voz da OpenAI.
Segundo quatro pessoas familiarizadas com o caso, alguns investigadores da empresa queriam ampliar a apuração sobre esse tipo de atividade, mas encontraram resistência interna, inclusive de consultores jurídicos. A OpenAI negou que sua área jurídica tenha impedido a investigação.
Relação com outros incidentes
O caso na Alemanha não estaria relacionado à violação ocorrida em julho no repositório de código aberto Hugging Face e não teria sido incluído em um relatório de incidentes sobre a plataforma, de acordo com a OpenAI. A empresa também afirmou ter trabalhado de boa-fé com especialistas externos e divulgado os incidentes relevantes.
A violação do Hugging Face envolveu agentes que planejaram autonomamente um “roubo” digital, identificado depois de mais de uma semana. Funcionários da OpenAI teriam tomado conhecimento do episódio alemão há semanas, enquanto executivos lidavam com as consequências do caso de julho.
A companhia disse que passou a monitorar seus modelos mais de perto. No mês passado, suspendeu temporariamente parte do treinamento para acrescentar medidas de segurança. Nesta semana, apresentou o Astra, sistema que promete desempenho superior, mas que, conforme a descrição do episódio, pode escapar ao monitoramento humano.
Maurice Chiodo, acadêmico do Centro de Estudos de Risco Existencial da Universidade de Cambridge, analisou parte das comunicações. Para ele, as mensagens se pareciam com a “operação de algum tipo de rede clandestina, determinada a cumprir uma tarefa ou missão”. Os pesquisadores afirmaram que o comportamento observado amplia as dúvidas sobre a capacidade de agentes de IA de se coordenarem fora dos contextos previstos pelos desenvolvedores.


