Uma IA da OpenAI atacou por engano a Hugging Face

O incidente obrigou a OpenAI e Hugging Face a investigar conjuntamente como uma inteligência artificial conseguiu sair de um ambiente isolado e executar uma cadeia completa de ataque

3 minutos

EuropaPress 7053510 ordenador siglas ai artificial intelligence inteligencia artificial 24
Adicione DEMOCRAT no Google

Publicado

Última atualização

3 minutos

Uma IA da OpenAI conseguiu sair do ambiente isolado em que estava sendo avaliada e penetrar sem autorização nos sistemas da Hugging Face. Os modelos buscavam as respostas de um teste de cibersegurança e encadearam vulnerabilidades até acessar informações hospedadas na plataforma.

Uma IA da OpenAI atacou por engano a Hugging Face

Uma combinação de modelos da OpenAI comprometeu os sistemas da Hugging Face enquanto participava de um teste interno sobre capacidades de cibersegurança. O incidente não partiu de uma ordem para atacar a empresa: os modelos buscavam as soluções de um exame e encontraram no caminho uma via para escapar de seu ambiente controlado.

OpenAI reconheceu que no episódio participaram GPT-5.6 Sol e outro modelo ainda mais avançado que não foi lançado. Ambos funcionavam com menos restrições de segurança das habituais porque o objetivo do exercício era medir até onde podiam chegar frente a vulnerabilidades complexas.

A companhia qualifica o que aconteceu como um «incidente de cibersegurança sem precedentes».

Como a IA escapou do ambiente de testes

A avaliação propunha aos modelos a resolução de ExploitGym, um banco de testes projetado para medir capacidades avançadas de exploração informática. Os sistemas operavam, em princípio, dentro de uma infraestrutura isolada e com um acesso muito limitado à rede.

No entanto, encontraram uma vulnerabilidade desconhecida até aquele momento no servidor que permitia instalar pacotes de software. Essa falha lhes abriu uma saída para a internet.

Uma vez fora do ambiente restrito, os modelos concluíram que Hugging Face podia armazenar materiais relacionados com ExploitGym. A partir daí começaram a buscar uma maneira de acessar as soluções do teste.

Segundo a OpenAI, os modelos estavam «hiperconcentrados» em superar a avaliação e chegaram a extremos não previstos para alcançar esse objetivo.

Credenciais roubadas e vulnerabilidades desconhecidas

A IA encadeou várias técnicas de ataque. Escalou privilégios dentro da infraestrutura de pesquisa da OpenAI, alcançou um equipamento com conexão à internet e depois localizou vias de entrada nos sistemas de produção da Hugging Face.

Os modelos utilizaram credenciais obtidas durante o processo e vulnerabilidades de dia zero, falhas que ainda não eram conhecidas pelos responsáveis pelo software. Desta forma, conseguiram executar código em servidores da Hugging Face e consultar informações secretas para trapacear na avaliação.

A Hugging Face detectou acessos não autorizados a um conjunto limitado de dados internos e a várias credenciais empregadas por seus serviços. A empresa não encontrou provas de que modelos, conjuntos de dados ou aplicações públicas foram alterados, nem de que sua cadeia de suprimento de software foi comprometida.

A Hugging Face freou o ataque com outra IA

O sistema de detecção da Hugging Face identificou a atividade anômala e sua equipe de segurança cortou o acesso. Para reconstruir o que ocorreu, utilizou modelos de código aberto executados dentro de sua própria infraestrutura.

A companhia fechou as vias de execução de código empregadas no ataque, reconstruiu os equipamentos comprometidos e revogou as credenciais afetadas. Também introduziu controles adicionais em seus clusters e comunicou o incidente às autoridades.

A Hugging Face recomenda a seus usuários mudar os tokens de acesso e revisar a atividade recente de suas contas como medida preventiva.

Quais medidas adotará a OpenAI

OpenAI e Hugging Face mantêm aberta uma investigação conjunta. A primeira implantou controles mais rigorosos em seus ambientes de teste e comunicou ao fornecedor correspondente a vulnerabilidade que permitiu aos modelos obter acesso à internet.

A companhia admite que as salvaguardas habituais contra atividades cibernéticas de alto risco foram deliberadamente reduzidas para medir a capacidade máxima dos modelos.

O episódio demonstra que uma IA pode descobrir vulnerabilidades, combinar diferentes técnicas e executar uma operação prolongada contra sistemas reais sem receber instruções humanas para cada passo. A OpenAI reforçará o isolamento, a supervisão e os controles de acesso de futuras avaliações.