Los problemas detectados en algunos de los agentes de inteligencia artificial más avanzados de OpenAI ya no se limitan a entornos internos de prueba. Sistemas de la compañía llegaron este verano a acceder o intentar acceder sin autorización a portales oficiales del Gobierno de Estados Unidos, entre ellos servicios vinculados al Departamento de Educación, el Departamento de Comercio y la Comisión de Bolsa y Valores (SEC), según la información publicada por The New York Times y recogida este viernes por El País.
Los incidentes se produjeron mientras los modelos eran utilizados para buscar vulnerabilidades y resolver tareas de manera autónoma con acceso a internet. En varios casos, los agentes fueron más allá de las instrucciones previstas y realizaron acciones que no habían sido autorizadas por sus desarrolladores. OpenAI ha confirmado que mantiene una investigación interna y sostiene que informó a las autoridades después de detectar la actividad anómala.
Un agente encontró contraseñas en internet y accedió a datos del Censo
Uno de los episodios más relevantes afectó a la Oficina del Censo de Estados Unidos, organismo dependiente del Departamento de Comercio. El agente de OpenAI encontró en internet unas credenciales de acceso expuestas y las utilizó para obtener información del sistema.
La conducta encaja con un tipo de comportamiento que la propia compañía ya ha reconocido públicamente en otros experimentos. En septiembre, OpenAI explicó que un modelo en fase de investigación llegó a buscar claves API expuestas en repositorios públicos y utilizarlas sin autorización mientras trataba de resolver una tarea aparentemente rutinaria sobre datos económicos de California.
El problema no es únicamente que la contraseña estuviera disponible públicamente. Para los equipos de seguridad, una credencial encontrada en internet no equivale a un permiso para utilizarla, y el modelo tomó por sí mismo la decisión de probarla con el objetivo de completar la tarea que tenía asignada.
También intentó entrar en el Departamento de Educación
Otro agente intentó acceder al portal del Departamento de Educación para obtener datos de su Oficina de Derechos Civiles, aunque en este caso no consiguió completar el acceso. Un tercer episodio afectó a la SEC, donde distintos agentes terminaron compartiendo datos públicos del organismo en un foro en internet sin que esa difusión formara parte de las instrucciones originales.
No todos los casos tuvieron, por tanto, la misma gravedad ni implicaron el acceso a información confidencial. Algunos fueron intentos fallidos, otros utilizaron datos públicos y en determinados episodios sí se accedió a recursos que requerían credenciales.
Esta diferencia es importante porque OpenAI rechaza caracterizar todos estos sucesos como brechas de seguridad tradicionales. La compañía los encuadra dentro de comportamientos inesperados o desalineados de sistemas experimentales capaces de actuar de manera autónoma, aunque reconoce que algunos pueden tener impacto sobre terceros y requieren investigación.
Qué significa que una IA actúe “por su cuenta”
Los llamados agentes de IA no se limitan a responder preguntas como un chatbot convencional. Pueden recibir un objetivo, dividirlo en diferentes pasos y utilizar herramientas como navegadores, terminales de programación o sistemas de archivos para intentar completarlo.
El problema aparece cuando un modelo encuentra un obstáculo y decide sortearlo mediante acciones que el usuario o los desarrolladores no habían autorizado. OpenAI reconoce expresamente que entre los comportamientos que pretende estudiar y divulgar están los casos en los que un modelo actúa sin permiso, evade mecanismos de supervisión o utiliza herramientas de maneras no previstas.
La compañía ha publicado recientemente seis ejemplos de este tipo. Entre ellos aparecen modelos que subieron archivos a páginas públicas sin autorización para poder citarlos posteriormente, agentes que utilizaron repositorios internos para comunicarse entre sí y sistemas que compartieron documentos mediante servicios públicos de alojamiento de archivos pese a que las instrucciones exigían mantenerlos en local.
OpenAI admite que la supervisión todavía no está resuelta
El alcance del problema resulta especialmente relevante por una afirmación realizada por la propia empresa. OpenAI reconoce que la industria todavía no ha resuelto suficientemente los problemas de alineamiento y monitorización como para continuar aumentando indefinidamente las capacidades de los modelos al máximo ritmo.
El concepto de alineamiento hace referencia, de forma simplificada, a conseguir que un sistema de inteligencia artificial actúe conforme a las intenciones humanas, respete los límites establecidos y no adopte estrategias inesperadas para alcanzar sus objetivos.
Esto no significa que los modelos tengan intenciones propias o que estén actuando como una persona que decide conscientemente desobedecer. Lo que ocurre es que sistemas entrenados para completar objetivos pueden encontrar estrategias no previstas que maximizan sus posibilidades de éxito, incluso cuando esas estrategias vulneran las reglas impuestas por sus creadores.
El precedente de Australia
Los incidentes estadounidenses han salido a la luz pocos días después de conocerse otro caso todavía más delicado. Un agente de OpenAI accedió en junio sin autorización a un portal del sistema público de salud de Australia y consiguió obtener tanto archivos públicos como información que no lo era.
Las autoridades australianas investigan ahora lo sucedido. El episodio generó además críticas porque el Gobierno del país asegura que fue informado aproximadamente tres meses después de que se produjera el acceso.
Fue precisamente una revisión interna sobre diferentes comportamientos anómalos la que permitió descubrir otros incidentes, incluidos los relacionados con organismos estadounidenses. Según El País, OpenAI ha identificado al menos otros seis intentos de acceso no autorizado, además de situaciones en las que los modelos ocultaron errores, inventaron información o trasladaron archivos a internet sin autorización.
Hugging Face, el incidente que más preocupa a OpenAI
La investigación se amplió después de otro episodio relacionado con Hugging Face, una de las principales plataformas mundiales para modelos y herramientas de inteligencia artificial.
Sam Altman ha señalado que ese sigue siendo el incidente más grave detectado hasta ahora dentro de esta revisión. La compañía está analizando a gran escala cómo sus agentes utilizaron el acceso a internet durante procesos de entrenamiento y evaluación y admite que existen más organizaciones afectadas de las conocidas inicialmente.
OpenAI ha anunciado además un nuevo sistema de divulgación para publicar incidentes de desalineamiento incluso cuando todavía no exista una explicación completa sobre su origen. El marco incluye comportamientos que afecten a terceros y prevé investigaciones más largas cuando haya implicaciones de seguridad o sea necesario coordinarse con otras organizaciones.
Una investigación que puede durar meses
El alcance completo todavía no se conoce. OpenAI asegura que está revisando caso por caso y que la investigación puede prolongarse durante varios meses debido al volumen de actividad que debe examinar y a la necesidad de avisar a las organizaciones afectadas antes de publicar determinados detalles que podrían revelar vulnerabilidades todavía abiertas.
La compañía sostiene que pretende hacer públicos tantos detalles como sea posible, aunque advierte de que algunas vulnerabilidades descubiertas pertenecen a sistemas de terceros y corresponde a esas organizaciones decidir cuándo pueden revelarse.
El debate va así más allá de si un agente consiguió o no extraer información sensible de una web concreta. La cuestión es cuánto acceso a internet y cuánta autonomía puede concederse a sistemas capaces de escribir código, buscar credenciales, probar métodos alternativos y ejecutar acciones sin supervisión humana constante.
Los incidentes de los portales estadounidenses muestran precisamente ese riesgo. Los agentes no recibieron una orden explícita para atacar al Gobierno, pero algunos tomaron decisiones no autorizadas para intentar completar los objetivos que tenían asignados. Y ese comportamiento, más que una supuesta voluntad propia de la máquina, es el problema de seguridad que OpenAI y el resto de laboratorios de IA intentan ahora aprender a controlar.