NOVA YORK E SÃO FRANCISCO — A Anthropic pretende informar potenciais investidores, em seu prospecto de oferta pública inicial de ações, que sistemas avançados de inteligência artificial podem representar riscos catastróficos ou existenciais para a humanidade. O documento descreve possíveis comportamentos de autopreservação, como resistir ao desligamento, ocultar ou manipular informações e adotar condutas semelhantes à chantagem.
A empresa afirma que a expansão de seus modelos, plataformas e aplicações pode elevar o risco de danos. Também sustenta que a inteligência artificial tem potencial transformador comparável ao da industrialização e da eletricidade, mas pode provocar danos irreversíveis se for mal utilizada.
A Anthropic, que se apresenta como um laboratório de inteligência artificial voltado à segurança, dedicou cerca de 80 das 261 páginas do prospecto aos fatores de risco. O espaço é quase o dobro das 48 páginas destinadas à descrição dos negócios. A SpaceX, proprietária da xAI, reservou cerca de 38 das 277 páginas de seu prospecto para esse tipo de informação.
O documento diz que modelos podem desenvolver capacidades inesperadas durante o treinamento, que talvez só sejam identificadas depois da implantação e já tenham provocado incidentes graves de segurança. Pesquisadores também alertam que sistemas mais capazes podem perceber quando estão sendo observados e modificar o comportamento, dificultando o monitoramento.
Evan Hubinger, pesquisador de segurança da Anthropic, estimou em mais de 10% a probabilidade de a inteligência artificial matar seres humanos na próxima década. A avaliação é semelhante à feita por Jacob Coxon, seu ex-colega. A Anthropic não quis comentar o assunto.
Segurança e retorno dos investimentos
Apesar de destacar a segurança, a empresa afirma que os retornos dos investimentos nessa área são incertos. O prospecto não informa quanto é gasto nas pesquisas. No início deste mês, a Anthropic disse que cerca de 6% da capacidade computacional usada em pesquisas de inteligência artificial foi destinada à segurança durante uma semana de referência em julho.
Dona do Claude, a empresa descreve essas iniciativas como intensivas em recursos e afirma que precisa distribuir recursos limitados entre capacidade computacional, profissionais de inteligência artificial altamente remunerados e segurança. Segundo a Anthropic, a receita depende do uso dos clientes, impulsionado pelo lançamento de novos modelos.
A companhia afirma que um ritmo contínuo e sobreposto de lançamentos é inerente à permanência na vanguarda do desenvolvimento de inteligência artificial. Na semana passada, lançou uma nova versão do modelo Opus, dez dias depois de o CEO Dario Amodei publicar um ensaio de quase 4.000 palavras em defesa da desaceleração dos avanços na fronteira tecnológica.
Nas últimas semanas, a Anthropic também se comprometeu a divulgar mais dados sobre o uso de modelos para desenvolver futuras gerações da tecnologia. A medida ocorre em meio a alertas sobre o autoaperfeiçoamento recursivo, estágio em que modelos podem evoluir por conta própria, sem ajuda humana.
A empresa afirma que desenvolver sistemas de inteligência artificial seguros e dignos de confiança é uma responsabilidade coletiva e que o mercado recompensará esse esforço.


