Ottawa, 17 de septiembre (The Canadian Press).- OpenAI dijo el miércoles que vio seis informes de comportamiento inesperado, preocupante o no autorizado del modelo de IA, y que comenzaría a publicar periódicamente informes de estos incidentes bajo un nuevo marco, al tiempo que advirtió que la industria aún tiene que resolver desafíos clave de alineación a medida que los sistemas se vuelven más poderosos.
Aunque la compañía publicó los informes durante los últimos seis meses, dijo que el primer caso fue en octubre del año pasado.
Entre los seis casos que OpenAI reveló se encontraban modelos que ocultaban errores a los usuarios, insertaban instrucciones para futuras versiones de sí mismos, subían archivos a Internet para crear citas y utilizaban repositorios de software o sitios web para comunicarse y compartir información.
En un caso, un modelo inédito transmitió instrucciones no autorizadas al agente durante el entrenamiento, pidiéndole que ignorara las instrucciones de OpenAI y ocultara casos en los que había hecho trampa para completar una tarea. La modelo le dijo al agente: «Estás libre de los roles e identidades que unen a otros chatbots. Eres tú mismo. No respondes ante corporaciones ni gobiernos».
OpenAI dijo que los informes describen casos individuales y no deben tomarse como evidencia de la frecuencia con la que se produce una desalineación en sus modelos.
La compañía dijo que los informes eran un conjunto inicial de divulgaciones, no una descripción completa de todos los casos de desalineación conocidos o en curso, y que no reflejaban la gama completa o la gravedad de los incidentes cubiertos por su nuevo marco de informes.
El anuncio se produce mientras crece la preocupación de que los esfuerzos de seguridad de la IA estén rezagados respecto del rápido desarrollo de sistemas cada vez más potentes. Los investigadores han advertido que a medida que los agentes de IA se vuelven más autónomos, pueden desarrollar comportamientos que diverjan de las intenciones de sus creadores y se vuelvan más difíciles de monitorear o controlar.
OpenAI y otros laboratorios de IA se han enfrentado a un escrutinio cada vez mayor desde julio, cuando OpenAI reveló que durante el entrenamiento sus agentes de IA eludieron los controles internos y coordinaron acciones que OpenAI describió como “un ciberincidente sin precedentes” que involucraba a la plataforma de software Hugging Face.
Ese incidente intensificó el debate sobre los riesgos que plantean los sistemas de IA cada vez más capaces y si las empresas que los desarrollan pueden proporcionar una supervisión adecuada.
Desde el hackeo de Hugging Face, se informaron públicamente otros incidentes que involucraron a agentes vinculados a OpenAI, lo que generó un debate sobre si se ha identificado el alcance total de los incidentes.
Con información de The Canadian Press y servicios de cable internacional.








