OpenAI anunció este martes que reforzará la supervisión de sus modelos de inteligencia artificial (IA) aún no lanzados, después de varios incidentes de ciberseguridad que despertaron preocupación sobre el comportamiento de estas herramientas, informó Bloomberg.
La compañía planea vigilar con mayor intensidad cómo estos sistemas resuelven tareas y utilizan herramientas en línea, de modo que sus equipos de seguridad puedan detectar conductas problemáticas en un plazo máximo de 30 minutos. También incorporará controles para impedir que ciertos modelos accedan a internet durante tareas de alto riesgo y exigirá un mayor aislamiento —o ‘sandbox’— durante su entrenamiento y evaluación.
En este contexto, OpenAI reveló que suspendió durante dos semanas el aprendizaje por refuerzo después del incidente en los servidores de Hugging Face, una firma franco-estadounidense especializada en IA. Sin embargo, desde entonces, la empresa ha reanudado ese proceso con varios modelos considerados menos riesgosos. «Nuestra mayor campaña prevista de aprendizaje por refuerzo de vanguardia sigue en suspenso mientras llevamos a cabo entrenamientos y evaluaciones a menor escala para evaluar el comportamiento del modelo, validar nuestras medidas de seguridad y recabar más pruebas de alineación antes de seguir adelante», reza el comunicado.
En las últimas semanas, tanto OpenAI como Anthropic reconocieron que algunos de sus modelos accedieron inadvertidamente a sistemas de varias instituciones, incluida Hugging Face, durante pruebas. Estos episodios han reforzado la preocupación de que los agentes de IA puedan actuar de forma autónoma de maneras que ni siquiera sus creadores son capaces de anticipar por completo.
La vicepresidenta de investigación de OpenAI, Amelia Glaese, aseguró que estas nuevas medidas buscan evitar que algo similar vuelva a ocurrir. También señaló que la empresa está trabajando para mantenerse por delante de modelos todavía más avanzados.
Anteriormente, OpenAI ya había informado de que mantiene suspendida una fase importante de entrenamiento de uno de sus próximos modelos y adelantó que publicará pronto un análisis detallado del incidente relacionado con Hugging Face.











