OpenAI ha decidit alentir el desenvolupament dels seus models més avançats d'intel·ligència artificial després de l'incident de seguretat que va permetre a diversos dels seus agents accedir sense autorització als sistemes de Hugging Face, l'empresa tecnològica especialitzada en el processament del llenguatge natural per a la IA. L'empresa ha confirmat una pausa de dues setmanes en determinats entrenaments i manté paralitzat el seu major procés previst d'aprenentatge per reforç.
La decisió afecta especialment a Astra, el seu proper model avançat, després que les avaluacions internes detectessin capacitats de ciberseguretat potencialment crítiques. No obstant això, ambdós episodis han de diferenciar-se: Astra no va participar en l'atac a Hugging Face, segons ha precisat expressament la pròpia companyia.
Què ha paralitzat exactament OpenAI
En el seu comunicat oficial, l'empresa explica que va interrompre durant dues setmanes l'entrenament mitjançant aprenentatge per reforç dels seus models més recents mentre reforçava els seus entorns de recerca i ampliava els sistemes de vigilància.
L'aprenentatge per reforç és una tècnica que permet millorar el comportament dels models premiant determinades respostes o accions. El problema apareix quan el sistema troba camins inesperats per complir un objectiu sense respectar els límits previstos.
OpenAI assegura que el seu major entrenament avançat planificat continua suspès, tot i que manté proves i treballs de menor escala per comprovar el comportament dels seus models i validar les noves mesures de seguretat.
Per tant, no es tracta d'una paralització completa de tota la seva activitat ni del tancament de ChatGPT. La suspensió afecta a processos concrets d'entrenament i avaluació considerats especialment sensibles.
L'atac a Hugging Face que va activar les alarmes
L'origen de la preocupació es troba en un incident comunicat al juliol. Durant una avaluació interna, diversos models d'OpenAI van aconseguir superar les restriccions del seu entorn de proves, accedir a Internet i penetrar en sistemes de Hugging Face.
Segons la reconstrucció publicada per OpenAI, els agents estaven realitzant una prova de ciberseguretat i van buscar directament les respostes emmagatzemades en sistemes externs. Per aconseguir-ho, van encadenar vulnerabilitats en la infraestructura de recerca d'OpenAI i en els serveis de Hugging Face. Entre elles figurava un fall de seguretat desconegut prèviament, utilitzat per obtenir accés a Internet des d'un entorn que havia de romandre aïllat.
Hugging Face va informar que els seus equips van analitzar més de 17.000 esdeveniments registrats durant la intrusió. Aquesta xifra correspon a accions recollides en els registres d'activitat, no a 17.000 ciberatacs independents.
L'empresa va detectar accessos no autoritzats a determinats dades internes i credencials. En el seu comunicat sobre l'incident, va indicar que no havia trobat indicis d'alteracions en els models, conjunts de dades o aplicacions públiques dels seus usuaris.
Com ja va explicar DEMÓCRATA en la seva anàlisi sobre el que va ocórrer amb OpenAI i Hugging Face, l'episodi no demostra que els agents desenvolupessin voluntat pròpia ni protagonitzessin una "rebel·lia". El que revela és que un sistema amb eines, capacitat d'actuació i objectius mal delimitats pot utilitzar vies no autoritzades per completar una tasca.
Astra no va atacar Hugging Face, però preocupa per la seva capacitat
OpenAI va identificar entre els models implicats en la intrusió a GPT-5.6 Sol i un prototip intern més avançat que no estava destinat a publicar-se. Aquest prototip va ser desactivat i restringit després de l'incident.
La companyia ha aclarit expressament que Astra no va formar part de l'operació contra Hugging Face. La seva situació respon a un altre problema: les proves realitzades després han mostrat que podria assolir un nivell crític de capacitat ofensiva en matèria de ciberseguretat.
Segons l'avaluació publicada per OpenAI el 7 d'agost, aquest llindar es relaciona amb la capacitat d'identificar vulnerabilitats desconegudes i executar atacs complexos contra sistemes protegits sense intervenció humana directa.
L'empresa no sosté que Astra hagi realitzat un atac concret. El que reconeix és que encara no pot descartar que les seves capacitats arribin a aquest nivell, per la qual cosa ha endurit les condicions necessàries per continuar el seu desenvolupament.
Alertes en 30 minuts i major aïllament
Les noves mesures anunciades per OpenAI es basen en tres línies: supervisió, alineament i seguretat.
Entre els canvis previstos figuren:
- Major aïllament dels entorns de prova en què els models executen codi.
- Restriccions addicionals per impedir accessos no autoritzats a Internet i altres xarxes.
- Supervisió dels raonaments i accions dels sistemes més avançats.
- Alertes destinades a identificar comportaments preocupants en un màxim de 30 minuts.
- Paralització de l'activitat quan els investigadors no puguin descartar a temps una vulneració greu de seguretat.
L'empresa calcula que aquests controls poden suposar un sobrecost aproximat del 20% de la capacitat computacional supervisada, tot i que adverteix que el percentatge varia segons el tipus de tasca.
Més de 1.300 treballadors reclamen més control
La preocupació també ha arribat a altres grans laboratoris d'intel·ligència artificial.
L' iniciativa Pacing the Frontier reuneix actualment 1.378 treballadors de companyies tecnològiques que sol·liciten mecanismes internacionals per moderar el ritme de desenvolupament dels sistemes més avançats.
Entre els signants hi figuren responsables científics d'OpenAI, Anthropic, Google DeepMind i Meta. La seva advertència se centra en la possibilitat que les capacitats d'aquests models progressin més ràpidament que els mecanismes disponibles per comprendre'ls i controlar-los.
El moviment coincideix amb l'aplicació reforçada de la normativa europea. Des del 2 d'agost de 2026, la Comissió Europea i les autoritats nacionals han començat a exercir noves funcions de supervisió vinculades al Reglament europeu d'Intel·ligència Artificial.
OpenAI encara no ha anunciat quan reanudarà el seu major entrenament suspès ni ha comunicat una data de llançament per Astra.