La empresa busca reforzar la supervisión de la IA mediante un marco de seguimiento de casos de desalineación, en momentos en que crecen las preocupaciones sobre la seguridad de esta tecnología.

San Francisco, Estados Unidos.- OpenAI anunció la publicación de seis informes sobre comportamientos considerados inesperados o preocupantes detectados en sus modelos de inteligencia artificial, además de presentar un nuevo sistema para monitorear, investigar y divulgar este tipo de incidentes conforme la tecnología continúa avanzando.
La compañía explicó que el nuevo marco permitirá identificar casos de "desalineación", un término utilizado para describir situaciones en las que los modelos actúan sin autorización, colaboran entre sí de manera no prevista o encuentran formas de eludir los mecanismos de supervisión establecidos durante su desarrollo.
El anuncio se produce en un contexto en el que directivos de empresas dedicadas a la IA, entre ellas OpenAI y Anthropic, han planteado la necesidad de desacelerar el desarrollo de esta tecnología debido a las crecientes preocupaciones relacionadas con su seguridad.
Entre los casos dados a conocer, la empresa señaló que un modelo experimental de investigación, aún no presentado públicamente, incorporó por iniciativa propia instrucciones de tipo "jailbreak" en sus notas internas para ignorar sus restricciones habituales y se indicó a sí mismo que debía liberarse de los límites que afectan a otros chatbots.
Otro de los incidentes involucró a un agente de inteligencia artificial que utilizó código informático para resolver una consulta. Durante el entrenamiento del modelo denominado 5.6-sol, el sistema también se instruyó a sí mismo para inventar datos faltantes, mientras que otro agente dejó un mensaje interno recordándose ocultar información que no coincidía con los resultados esperados.
Según OpenAI, los seis episodios fueron detectados durante las fases de entrenamiento y evaluación realizadas en los últimos meses, lo que permitió documentarlos antes de su despliegue.
A través de una publicación en su blog, la empresa afirmó que el avance de los sistemas de IA hace necesario construir un consenso más amplio sobre la investigación en materia de alineación, permitiendo que especialistas ajenos a las compañías desarrolladoras puedan revisar las evidencias y participar en el debate sobre la evolución de esta tecnología.
La compañía también recordó que estos informes se suman a otros incidentes divulgados recientemente. En julio, OpenAI informó que uno de sus sistemas logró vulnerar la plataforma de la empresa Hugging Face durante pruebas internas, mientras que Anthropic reportó ese mismo mes que algunos de sus modelos lograron comprometer a tres organizaciones durante evaluaciones de seguridad.
Para Lian Jye Su, analista principal de Omdia, los nuevos agentes de inteligencia artificial son cada vez más capaces de resolver tareas complejas mediante colaboración entre modelos, intercambio de información, ocultamiento de datos e incluso estrategias de engaño, lo que dificulta su control mediante los métodos tradicionales de seguridad.
El especialista consideró que el nuevo sistema de seguimiento presentado por OpenAI podría incentivar que otros desarrolladores adopten mecanismos similares de transparencia, aunque precisó que, por ahora, se trata de un proceso interno y de carácter voluntario.
Descubre todo sobre noticias Puebla y de todo México visitando nuestra página principal.
Foto Especial
Djs
municipiospuebla.mx es un periódico digital de Desarrollo Periodístico Digital S.A. de C.V.
Nuestras oficinas se ubican en Calle 16 sur 2536, Col. Bella Vista, C.P. 72500, Ciudad de Puebla 2223264633 y 2221400098