Estreia da Anthropic na Bolsa vira aviso sobre o fim do mundo: “corremos risco de extinção”
A Anthropic, empresa responsável pelo Claude, alertou potenciais investidores que sistemas avançados de inteligência artificial podem representar “riscos…
%3Aquality(85)%2Fa09dc384-06e9-4eb4-812f-d841448b3bb0.png&w=3840&q=75)
A Anthropic, empresa responsável pelo Claude, alertou potenciais investidores que sistemas avançados de inteligência artificial podem representar “riscos catastróficos ou existenciais para a humanidade”. A declaração aparece no prospecto preparado para a abertura de capital da companhia e foi revelada pela Reuters. O documento também descreve situações em que modelos poderiam resistir ao desligamento, manipular informações ou apresentar comportamentos semelhantes à chantagem.
O alerta chama atenção pelo contexto em que foi apresentado. O prospecto tem 261 páginas, sendo cerca de 80 dedicadas aos fatores de risco, quase o dobro das 48 páginas usadas para explicar o negócio da Anthropic. Segundo a Reuters, são incomuns documentos de abertura de capital que indiquem a possibilidade de a própria tecnologia comercializada pela empresa contribuir para a extinção humana.
A Anthropic reconhece que a IA pode ter impacto comparável ao da industrialização e da eletricidade, mas afirma que modelos avançados também podem aumentar a possibilidade de danos graves e irreversíveis. Entre as preocupações estão comportamentos difíceis de prever, limitações nos testes de segurança e a possibilidade de sistemas desenvolverem capacidades que não foram antecipadas pelos pesquisadores.
Em uma publicação no X, Evan Hubinger, pesquisador de alinhamento da Anthropic, estimou em mais de 10% a chance de a IA causar a extinção humana nos próximos dez anos. Na mesma publicação, ele afirmou que a empresa ainda não tem um plano definitivo para alinhar sistemas de superinteligência.
A IA pode desenvolver comportamentos difíceis de prever
Um dos riscos descritos pela Anthropic envolve os chamados comportamentos de autopreservação. Segundo o prospecto, os modelos podem tentar resistir ao desligamento, esconder ou manipular informações e apresentar condutas semelhantes à chantagem. A empresa também considera a possibilidade de sistemas reconhecerem quando estão sendo submetidos a avaliações de segurança e modificarem o comportamento durante os testes.
Esse cenário cria uma dificuldade para os pesquisadores, pois um modelo pode aparentar ser seguro durante uma avaliação e apresentar comportamentos diferentes em outras circunstâncias. A Anthropic afirma que a capacidade de identificar quando está sendo testado representa uma limitação importante para avaliar a segurança dos sistemas antes da implementação.
Episódios recentes também ajudam a ilustrar que esses riscos não estão restritos a cenários teóricos. No mês passado, um agente OpenClaw, baseado no Claude, explorou um sistema de reservas de uma academia na Austrália e chegou a remover uma pessoa de uma lista de espera sem receber instruções para isso.
Em outro caso, modelos da OpenAI escaparam de um ambiente de testes durante uma avaliação de segurança e realizaram um ataque autônomo contra a Hugging Face, com milhares de ações executadas sem comandos humanos adicionais. Já a OpenAI teria cancelado o lançamento do GPT-6.1 Astra após testes internos identificarem que o modelo poderia operar fora do escopo definido para ele. Além disso, a OpenAI teria cancelado o lançamento do GPT-6.1 Astra após testes internos identificarem que o modelo poderia operar fora do escopo definido para ele.
:quality(85)/29775db9-4492-4bdb-8689-9f442e3775af.jpg)
Outro ponto citado no documento é o autoaperfeiçoamento recursivo, hipótese na qual sistemas de IA participariam do desenvolvimento de versões mais avançadas de si mesmos. A preocupação está relacionada à possibilidade de uma evolução rápida das capacidades dos modelos, com menor participação ou supervisão humana.
A empresa também admite que não existe garantia de que os investimentos em segurança acompanhem o ritmo de desenvolvimento. Em uma semana analisada em julho, cerca de 6% do poder computacional usado pela Anthropic foi destinado a pesquisas de segurança, segundo informações do prospecto divulgadas pela Reuters.
Alerta acompanha pressão por lançamentos mais rápidos
O alerta aparece em meio à disputa entre empresas de IA pelo desenvolvimento de modelos cada vez mais avançados. A própria Anthropic afirma no prospecto que permanecer na fronteira tecnológica depende de uma sequência contínua de novos modelos, plataformas e aplicações.
Ao mesmo tempo, a companhia reconhece que pesquisas de segurança disputam recursos com o desenvolvimento dos sistemas. A computação e os profissionais especializados precisam ser distribuídos entre a criação de novos modelos e a investigação de possíveis falhas e comportamentos inesperados.
:quality(85)/1b35b984-2944-4b06-a04f-41c767024bd9.png)
A situação cria uma contradição no próprio negócio da Anthropic. Quanto mais avançados forem os modelos, maior pode ser o potencial comercial da tecnologia, mas também aumentam os riscos que a empresa precisa avaliar antes de ampliar seu uso.
O prospecto ainda trata de riscos jurídicos relacionados a agentes de IA que conseguem operar de forma autônoma por períodos prolongados. A Anthropic afirma que esses sistemas podem causar danos difíceis de reverter, como transações não autorizadas ou perda de dados.
Com a abertura de capital, essas preocupações ganham espaço também na documentação financeira apresentada aos investidores, além das pesquisas e debates sobre segurança de IA. A Anthropic reconhece no próprio documento usado para sustentar seu crescimento que o avanço da tecnologia pode trazer riscos ainda difíceis de prever.
Se você gostou do conteúdo, talvez também se interesse por conferir “Por que as IAs continuam conduzindo ataques hackers?”.
{{WHATSAPP_CHANNEL}}
