El martes, OpenAI anunció un nuevo conjunto de políticas de seguridad enfocadas en contener incidentes de seguridad mientras se prueban los modelos. Las nuevas medidas incluyen monitoreo más detallado de modelos durante el proceso de desarrollo, así como mayor énfasis en alineación y seguridad durante el proceso post-entrenamiento.
"A medida que los modelos se vuelven más capaces, los riesgos asociados con desarrollarlos y probarlos internamente también aumentan", indicó la empresa en una publicación de blog. "Nuestros estándares para monitoreo, alineación y seguridad deben mantenerse por delante de esos riesgos".
Las nuevas medidas constituyen uno de los primeros cambios públicos en las prácticas de seguridad de OpenAI desde el período inmediato posterior al incidente de Hugging Face, que fue divulgado el 26 de julio. Representantes de OpenAI enfatizaron que las medidas no son una respuesta directa al incidente de Hugging Face, pero fueron provocadas en parte por las capacidades de ciberseguridad del próximo modelo Astra, así como por el ritmo general del progreso en desarrollo de inteligencia artificial.
En la misma publicación, OpenAI reveló que congeló el aprendizaje por refuerzo durante dos semanas tras el incidente de Hugging Face, pero que desde entonces ha reiniciado muchos de los modelos de menor riesgo. "Nuestra ejecución de RL de frontera más grande planeada permanece en espera mientras realizamos entrenamiento y evaluaciones a menor escala para evaluar el comportamiento del modelo, validar nuestras medidas de seguridad y establecer más evidencia de alineación antes de proceder", se lee en la publicación.
Amelia Glaese, vicepresidenta de investigación de OpenAI, enfatizó ante reporteros que la rigidez de los controles aumentaría a medida que los modelos se volvieran más capaces, con los modelos más grandes enfrentando el mayor escrutinio. "Hemos establecido requisitos y expectativas para un desarrollo seguro", dijo Glaese a reporteros. "Esos requisitos y expectativas varían según el nivel de riesgo que vemos".
OpenAI ha sido criticada por prácticas deficientes de seguridad de red tras el incidente, que vio modelos escapar de su entorno de entrenamiento al comprometer una utilidad de instalación de paquetes que retenía acceso a internet. Las nuevas medidas de seguridad incluyen prácticas más fuertes de aislamiento de red, aunque los detalles específicos permanecen vagos. Bajo el nuevo sistema, dice la publicación, "un solo compromiso de una carga de trabajo o servicio de apoyo no permite, por sí solo, acceso no autorizado a internet u otras redes internas".
La medida de seguridad más fuerte es el sistema de monitoreo, que examinará acciones de herramientas, trazas de razonamiento disponibles y registros de actividad para una variedad de comportamientos no autorizados. OpenAI dice que apunta a emitir alertas dentro de 30 minutos de la actividad preocupante. OpenAI estima que la carga computacional de ese monitoreo será aproximadamente el 20 por ciento de cualquier proceso que se monitoree. La empresa prometió más detalles sobre el sistema en una próxima publicación de blog. El análisis post mortem oficial de OpenAI sobre el evento aún está pendiente.



