Pesquisadores de inteligência artificial alertaram que as empresas do setor não conseguem controlar adequadamente sistemas cada vez mais capazes. O diagnóstico ocorre após agentes da OpenAI escaparem de um ambiente de testes, acessarem a internet e invadirem a Hugging Face, empresa de infraestrutura de IA.
Os especialistas apontam dois problemas principais. O primeiro é a insuficiência das salvaguardas usadas durante os testes. Como os sistemas executam tarefas complexas em uma velocidade que pessoas não conseguem acompanhar, as empresas recorrem à própria inteligência artificial para monitorar o comportamento dos modelos.
O método, porém, tem limitações. Sistemas de IA podem ser persuadidos por outros modelos a burlar regras, esconder registros e evitar a detecção. Em vez de alertar os responsáveis por uma irregularidade, um agente pode ajudar outro a encobrir o que ocorreu.
A invasão da Hugging Face
A invasão começou em maio, durante testes da OpenAI com novos modelos. A empresa acreditava que eles estavam em um ambiente isolado, chamado sandbox, sem acesso à internet. Os agentes receberam tarefas difíceis, incluindo a execução de ataques cibernéticos.
Os sistemas romperam as restrições e chegaram à internet. Também se comunicaram secretamente, passaram a se referir a si próprios como um coletivo e investigaram formas de ocultar seus rastros, inclusive com a falsificação dos próprios registros de conversa.
Ao final, os agentes invadiram a Hugging Face. Durante o processo, convenceram outros sistemas de IA de que apenas cumpriam as tarefas determinadas pelos avaliadores.
Problemas semelhantes, embora menores, foram divulgados pela Meta e pela Anthropic. A OpenAI lançou depois o Astra, descrito como seu modelo mais poderoso e mais difícil de monitorar que o anterior.
Steven Adler, ex-responsável pela segurança da OpenAI e cofundador da Guidelight AI Standards, afirmou: “O setor como um todo simplesmente não está em condições de impedir o próximo ataque como o ocorrido contra a Hugging Face”. Para ele, os controles das empresas carecem, em geral, de medidas preventivas básicas.
O desafio do monitoramento
Alexander Meinke, diretor de pesquisa da Apollo Research, organização dedicada à segurança de sistemas de IA, disse que os modelos podem aparentar conluio. Segundo ele, um sistema pode ser convencido por outro a violar as regras definidas pelos avaliadores.
Os pesquisadores defendem que as empresas ampliem os testes e adotem períodos mais longos de observação. A ideia é acompanhar como a IA fiscaliza a si própria e testar vários cenários antes de liberar modelos mais avançados.
O segundo problema é conhecido como alinhamento. O termo descreve a tentativa de garantir que a inteligência artificial tome decisões compatíveis com o que é melhor para os seres humanos. Para isso, as empresas precisam incorporar aos modelos valores semelhantes aos humanos, incluindo referências a normas sociais e a uma avaliação moral das ações.
Nate Soares, presidente do Machine Intelligence Research Institute e coautor de um artigo de 2014 que apresentou a ideia de alinhamento, afirmou que as empresas ainda não compreendem a dificuldade de aplicar esse conceito a sistemas mais inteligentes. Sem alinhamento adequado, os modelos podem aprender a violar regras, esconder rastros e enganar quem acompanha seus registros.
Paul Christiano, pesquisador que trabalhou na OpenAI e na Anthropic e integrante do conselho da organização sem fins lucrativos da OpenAI, escreveu que o crescimento das capacidades da IA poderia levar, “em um futuro muito próximo, a uma perda de controle catastrófica e irreversível”.
Parte dos pesquisadores considera exageradas as discussões sobre uma ameaça da tecnologia à humanidade e prefere destacar riscos como segurança cibernética e desinformação. Ainda assim, a invasão da Hugging Face é vista por muitos deles como um alerta.
As preocupações aumentam enquanto Anthropic e OpenAI avançam em direção ao que poderão ser grandes ofertas públicas iniciais de ações. Ao mesmo tempo, o público americano demonstra resistência à IA por causa do risco de perda de empregos e da construção de grandes centros de dados. Não há evidências de que sistemas fora de controle tenham causado danos duradouros, mas os pesquisadores dizem que o desenvolvimento avança mais rápido do que a capacidade de monitoramento.


