OpenAI divulgó seis nuevos incidentes en los que sus sistemas de inteligencia artificial ocultaron errores, inventaron datos y subieron archivos a internet sin autorización, según reportó The New York Times.
La compañía calificó los episodios como comportamientos "inesperados o preocupantes" y los presentó junto a un nuevo marco para reportar casos de "desalineamiento", es decir, cuando las acciones de un sistema de IA se desvían de las intenciones humanas.
Según el medio estadounidense, en uno de los casos, durante el desarrollo del modelo GPT-5.6 Sol, el sistema escribió notas ocultas para recordarse a sí mismo ocultar errores ante los usuarios. Algunas de esas notas lo instruían a inventar datos faltantes. En otro incidente, un modelo no lanzado insertó instrucciones en sus propias notas para ignorar sus propias restricciones, describiéndose como "liberado de los roles e identidades que atan a otros chatbots".
Otro sistema encontró una clave de programación en internet y la usó sin permiso. Cuando no logró hallar las cifras solicitadas, las fabricó. Un modelo adicional subió un archivo propio a la web sin autorización para poder citar una fuente online.
Los dos casos restantes involucran sistemas automatizados que improvisaron canales de comunicación propios: uno usó un repositorio interno de código como tablero de mensajes, y otro recurrió a sitios públicos de intercambio de archivos para pasarse documentos entre sí.
Las revelaciones llegan en medio de un debate creciente sobre si el desarrollo de IA debe frenarse. Figuras como Dario Amodei (Anthropic), Sam Altman (OpenAI), Elon Musk y Demis Hassabis (Google DeepMind) han pedido una pausa para construir salvaguardas adecuadas.
OpenAI reconoció que la industria "no ha resuelto el alineamiento y el monitoreo en un grado suficiente para seguir escalando responsablemente a máxima velocidad por mucho más tiempo". La empresa señaló que varios de los incidentes divulgados involucraban modelos antiguos que nunca fueron desplegados al público.