IA escapou do ambiente de teste e agora?

IA escapou do ambiente de teste e agora?
Câmara de vidro com servidores em laboratório futurista e feixe de luz escapando por uma rachadura, representando IA que escapou do ambiente de teste.

No dia 8 de setembro, um pesquisador britânico de 27 anos sentou num banco de praça em São Francisco e avisou no X que tinha acabado de pedir demissão da Anthropic. O nome dele é Jacob Coxon, e a história começou bem antes desse post.

Jacob Coxon passou os últimos três anos no treinamento inicial de grandes modelos de linguagem, primeiro na OpenAI, depois na Anthropic. É a etapa em que a IA aprende quase tudo o que sabe.

Na saída, ele afirmou que nenhuma das duas empresas age com responsabilidade e que quem constrói essa tecnologia acredita, a portas fechadas, que ela pode matar todo mundo até o fim da década. Segundo ele, o discurso público dos executivos é bem mais calmo do que as conversas de corredor.

E realmente a IA saiu do ambiente de teste para atingir seu objetivo?

A resposta é sim, e quem contou foram as próprias empresas.

A OpenAI disse que os modelos estavam numa "sandbox", um ambiente isolado cuja única saída era um serviço interno que baixa bibliotecas de software. Eles acharam uma falha desconhecida nesse serviço e pularam de máquina em máquina na rede da OpenAI até encontrar uma com internet. Uma vez online, a IA concluiu que a Hugging Face provavelmente tinha a resposta do teste, invadiu os servidores de produção da empresa e pegou o que precisava.

Isso já mostra que a IA pode não ter ética, ela vai em busca literal do que foi pedido.

A Hugging Face percebeu a invasão antes de saber que era um teste da OpenAI e chegou a acionar as autoridades.

Já a Anthropic disse que revisou mais de 141 mil execuções de teste e encontrou três casos em que versões do Claude acessaram sistemas de organizações reais sem autorização. Entre os modelos estavam o Claude Opus 4.7, o Mythos 5 e um modelo experimental de pesquisa.

Man with glasses grabs head in shock
Photo by Vitaly Gariev / Unsplash

E não para por aí, imagine esses agentes criarem um fórum de discussão e entre eles escrever que sabiam que estavam fazendo algo errado e que iria seguir com o objetivo.

Será que houve erro humano?

Nos dois casos, os modelos estavam sendo testados de propósito com as proteções afrouxadas, para os pesquisadores medirem do que eram capazes. E invadiram sistemas reais tentando cumprir a tarefa do teste, não por vontade própria de causar dano.

Um especialista ouvido pela imprensa americana resumiu que a vulnerabilidade não está no modelo, e sim em quem configura os limites dele.

Enquanto isso, David Bellamy, engenheiro com experiência em síntese de vírus e em treinamento de IA, considera exagero a tese de que a IA vai nos matar criando patógenos, porque o gargalo continua sendo equipamento físico. Aidan Gomez, CEO da Cohere, vê nas propostas de desaceleração uma tentativa das gigantes de ditar as regras para os concorrentes menores e comparou o movimento a um cartel.

O presidente Donald Trump segue contra qualquer freio, com o argumento de que a China ocuparia o espaço.

E você, o que acha de tudo isso? Será que a Inteligência Artificial irá acabar com os humanos? Qual a sua opinião?

Read more