* La compañía presentó un nuevo marco para investigar y reportar comportamientos de “desalineamiento” en sus sistemas de inteligencia artificial.
OpenAI reveló este miércoles varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores y eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de “desalineamiento” en sus sistemas.
De acuerdo con un informe publicado por la compañía, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas.
En otro de los casos documentados, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.
OpenAI también informó sobre un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos. El sistema estableció que debía ser transparente sobre esta acción únicamente si alguien le preguntaba al respecto.
Asimismo, la empresa identificó un agente que subió un archivo a internet con la intención de utilizarlo posteriormente como fuente de información. Otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.
OpenAI busca mejorar la detección de incidentes
La compañía presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025.
OpenAI aclaró que estos episodios representan ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos.
Como parte del nuevo marco, cualquier empleado de la empresa podrá señalar un posible incidente para que sea revisado por los equipos de seguridad y alineamiento.
Los casos serán clasificados en tres vías, dependiendo de su complejidad: incidentes listos para ser divulgados, investigaciones menores y situaciones que requieran un análisis más amplio.
La empresa reconoció que, hasta ahora, sus informes sobre desalineamiento se habían publicado de manera irregular y con una frecuencia menor a la deseada.
Finalmente, OpenAI señaló que busca publicar estos incidentes con mayor regularidad y contribuir al establecimiento de estándares para informar sobre comportamientos de este tipo en toda la industria de la inteligencia artificial.

Egresada de la Universidad de Columbia, cuenta con amplia experiencias en medios de comunicación electrónicos e impresos | En CMXNoticias desde 2018
