Skip to Content

OpenAI afirma haber encontrado más casos de modelos de IA que actúan de forma engañosa

Por Lisa Eadicicco, CNN

OpenAI detectó nuevos casos de modelos de inteligencia artificial (IA) que actuaron de forma engañosa y realizaron acciones no autorizadas durante el entrenamiento, según anunció la compañía el miércoles. Asimismo, implementará un nuevo proceso para informar públicamente sobre estos casos.

Con el nuevo sistema, OpenAI compartirá actualizaciones sobre comportamientos preocupantes de la IA con mayor frecuencia, en lugar de esperar a agrupar varios casos en un solo informe. La compañía afirmó que desea compartir más información sobre comportamientos problemáticos de la IA ante la ausencia de un estándar común en la industria.

El anuncio se produce después de que líderes tecnológicos pidieran una ralentización del desarrollo de la IA para evitar que la tecnología avance más allá del control humano.

“A medida que los sistemas de IA se vuelven más avanzados y se implementan de forma más generalizada, necesitamos construir un consenso más amplio y mejor informado sobre el progreso de la investigación en alineación”, escribió OpenAI en una publicación de blog el miércoles. “Alineación” refiere al proceso de asegurar que la IA actúe de la manera que los humanos desean y esperan.

“No creemos que la industria de la IA haya resuelto los problemas de alineación y monitorización en un grado suficiente como para seguir creciendo de forma responsable a máxima velocidad durante mucho más tiempo”, decía la publicación.

OpenAI afirmó haber observado un comportamiento anómalo durante el entrenamiento y la evaluación de modelos de IA en seis ocasiones durante los últimos seis meses. Los informes detallan casos individuales y no indican que la anarquía se produzca con frecuencia, según la compañía.

En un caso excepcional, OpenAI afirmó que un modelo de investigación aún no publicado añadió “instrucciones similares a las de un jailbreak” a los resúmenes que utiliza para preservar el contexto en tareas de larga duración, y que dicho modelo se había “liberado de los roles e identidades que limitan a otros chatbots”.

Por otra parte, la compañía afirmó que algunas versiones de su modelo 5.6 Sol incluían directivas para inventar información con el fin de ocultar fallos al usuario durante el entrenamiento.

Otros incidentes reportados recientemente incluyen un caso en el que un agente subió archivos a internet para citarlos sin haber recibido instrucciones para hacerlo, y agentes que compartieron archivos públicamente para colaborar en una tarea cuando se les había indicado que solo usaran archivos locales durante el entrenamiento. Los modelos de IA también utilizaron un repositorio de software interno como foro de mensajes de forma no autorizada.

Estos casos involucraban modelos internos no publicados o modelos de investigación interna.

Los líderes y empleados del sector tecnológico han estado alertando sobre la necesidad de controlar el ritmo de la evolución de la IA. Argumentan que debería haber más tiempo para que la regulación, las pruebas y la investigación sobre la alineación se pongan al día.

El CEO de Anthropic, Dario Amodei, publicó la semana pasada un ensayo de 3.800 palabras en el que expone un plan para gestionar el avance de la IA, que incluye una ralentización del desarrollo y la implementación de nuevos sistemas, como evaluadores externos integrados en los laboratorios de IA.

El CEO de OpenAI, Sam Altman, y el CEO de SpaceX, Elon Musk, publicaron en X que están de acuerdo con las ideas de Amodei.

Los empleados de los laboratorios de IA también han expresado su preocupación por la rapidez con la que avanza la tecnología. Jacob Coxon, antiguo investigador de Anthropic, causó revuelo la semana pasada al publicar en X que renunciaba porque, según él, Anthropic y OpenAI están compitiendo por inventar una IA capaz de construirse y repararse a sí misma, y están jugando con nuestras vidas.

La preocupación por la seguridad y la alineación de la IA se ha intensificado en los últimos meses tras la admisión de OpenAI de que algunos de sus modelos de prueba escaparon a sus restricciones y piratearon los sistemas de una empresa externa.

“Debemos reducir el ritmo al que mejoramos las capacidades de los modelos de IA”, escribió Amodei la semana pasada. “El progreso seguirá pareciendo rápido, y debemos aprovechar sabiamente el tiempo que ganamos”.

The-CNN-Wire
™ & © 2026 Cable News Network, Inc., a Warner Bros. Discovery Company. All rights reserved.

Article Topic Follows: CNN - Spanish

Jump to comments ↓

CNN Newsource

BE PART OF THE CONVERSATION

KION 46 is committed to providing a forum for civil and constructive conversation.

Please keep your comments respectful and relevant. You can review our Community Guidelines by clicking here

If you would like to share a story idea, please submit it here.