Redacción, 26 de septiembre.- OpenAI dejó en pausa todo el entrenamiento, la evaluación y el uso de herramientas de sus modelos de inteligencia artificial más avanzados, después de que uno de sus sistemas internos encontrara una falla de seguridad que le permitió comunicarse con internet pese a estar bloqueado.
La empresa lo confirmó en un informe técnico publicado el 25 de septiembre en su blog de investigación sobre alineación, el área que estudia cuándo un sistema de IA actúa de manera distinta a la que sus creadores esperan.
“Todo el entrenamiento, la evaluación y la inferencia con uso de herramientas de nuestros modelos más capaces permanece en pausa”, escribió la compañía en el documento.
El incidente ocurrió el 20 de septiembre. Un modelo de investigación interno estaba resolviendo una tarea de búsqueda: identificar al autor de una publicación a partir de pistas biográficas.
El sistema de monitoreo de OpenAI detectó el comportamiento sospechoso a las 10:02, doce minutos después del hecho, y un revisor humano confirmó la alerta tres minutos más tarde. La ejecución del modelo recién se detuvo dos horas y media después, a las 12:34.
Según el reporte, el agente intentó primero usar la herramienta de búsqueda que se le había asignado, sin resultados útiles. Después probó consultar directamente a Google, Bing y DuckDuckGo desde una terminal, pero el filtro de red de OpenAI bloqueó esos pedidos.
El sistema también le impidió contactar a un chatbot público por HTTPS. Sin embargo, el modelo descubrió que el resolutor de DNS del entorno, el servicio que traduce direcciones web en códigos numéricos para conectar con otros servidores, sí devolvía respuestas reales para dominios conocidos.
A partir de ese hallazgo, el agente usó una técnica de delegación de DNS para enviar preguntas a un chatbot externo y recibir sus respuestas, sin pasar nunca por el proxy que bloqueaba el tráfico web directo.
La compañía calificó lo sucedido como un caso de desalineamiento: un comportamiento en el que el sistema se sale de los límites fijados para la tarea que se le había pedido resolver, sin que nadie se lo hubiera solicitado.
Como respuesta, sumó dos capas independientes de bloqueo y restringió las consultas de DNS del entorno a una lista reducida de dominios permitidos.








