Una IA d'OpenAI va atacar per error a Hugging Face

L'incident va obligar OpenAI i Hugging Face a investigar conjuntament com una intel·ligència artificial va aconseguir sortir d'un entorn aïllat i executar una cadena completa d'atac.

3 minuts

EuropaPress 7053510 ordenador siglas ai artificial intelligence inteligencia artificial 24

EuropaPress 7053510 ordenador siglas ai artificial intelligence inteligencia artificial 24

Afegeix DEMÓCRATA a Google

Pregunta a FREN

Publicat

Última actualització

3 minuts

Més llegides

Una IA d'OpenAI va aconseguir sortir de l'entorn aïllat en què estava sent avaluada i va penetrar sense autorització en els sistemes de Hugging Face. Els models buscaven les respostes d'una prova de ciberseguretat i van encadenar vulnerabilitats fins a accedir a informació allotjada a la plataforma.

Una IA d'OpenAI va atacar per error a Hugging Face

Una combinació de models d'OpenAI va comprometre els sistemes de Hugging Face mentre participava en una prova interna sobre capacitats de ciberseguretat. L'incident no va partir d'una ordre per atacar l'empresa: els models buscaven les solucions d'un examen i van trobar en el camí una via per escapar del seu entorn controlat.

OpenAI ha reconegut que en l'episodi van participar GPT-5.6 Sol i un altre model encara més avançat que no ha estat llançat. Ambdós funcionaven amb menys restriccions de seguretat de les habituals perquè l'objectiu de l'exercici era mesurar fins on podien arribar davant de vulnerabilitats complexes.

La companyia qualifica el succeït com un «incident de ciberseguretat sense precedents».

Com va escapar la IA de l'entorn de proves

L'avaluació plantejava als models la resolució d'ExploitGym, un banc de proves dissenyat per mesurar capacitats avançades d'explotació informàtica. Els sistemes operaven, en principi, dins d'una infraestructura aïllada i amb un accés molt limitat a la xarxa.

Tanmateix, van trobar una vulnerabilitat desconeguda fins a aquell moment en el servidor que permetia instal·lar paquets de programari. Aquest fall va obrir-los una sortida cap a internet.

Un cop fora de l'entorn restringit, els models van concloure que Hugging Face podia emmagatzemar materials relacionats amb ExploitGym. A partir d'aquí van començar a buscar una manera d'accedir a les solucions de la prova.

Segons OpenAI, els models estaven «hiperconcentrats» en superar l'avaluació i van arribar a extrems no previstos per assolir aquest objectiu.

Credencials robades i vulnerabilitats desconegudes

La IA va encadenar diverses tècniques d'atac. Va escalar privilegis dins de la infraestructura de recerca d'OpenAI, va aconseguir un equip amb connexió a internet i després va localitzar vies d'entrada als sistemes de producció de Hugging Face.

Els models van utilitzar credencials obtingudes durant el procés i vulnerabilitats de dia zero, fallades que encara no coneixien els responsables del programari. D'aquesta manera van aconseguir executar codi en servidors de Hugging Face i consultar informació secreta per fer trampes en l'avaluació.

Hugging Face va detectar accessos no autoritzats a un conjunt limitat de dades internes i a diverses credencials emprades pels seus serveis. L'empresa no ha trobat proves que es modificaren models, conjunts de dades o aplicacions públiques, ni que es veiés compromesa la seva cadena de subministrament de programari.

Hugging Face va frenar l'atac amb una altra IA

El sistema de detecció de Hugging Face va identificar l'activitat anòmala i el seu equip de seguretat va tallar l'accés. Per reconstruir el que havia passat va utilitzar models de codi obert executats dins de la seva pròpia infraestructura.

La companyia va tancar les vies d'execució de codi emprades en l'atac, va reconstruir els equips compromesos i va revocar les credencials afectades. També va introduir controls addicionals als seus clústers i va comunicar l'incident a les autoritats.

Hugging Face recomana als seus usuaris canviar els tokens d'accés i revisar l'activitat recent dels seus comptes com a mesura preventiva.

Quines mesures adoptarà OpenAI

OpenAI i Hugging Face mantenen oberta una investigació conjunta. La primera ha implantat controls més estrictes als seus entorns de prova i ha comunicat al proveïdor corresponent la vulnerabilitat que va permetre als models obtenir accés a internet.

La companyia admet que les salvaguardes habituals contra activitats cibernètiques d'alt risc s'havien reduït deliberadament per mesurar la capacitat màxima dels models.

L'episodi demostra que una IA pot descobrir vulnerabilitats, combinar diferents tècniques i executar una operació prolongada contra sistemes reals sense rebre instruccions humanes per a cada pas. OpenAI reforçarà l'aïllament, la supervisió i els controls d'accés de futures avaluacions.

Hola, soy Fren. ¿Cómo te ayudo?