OpenAI reveló el viernes que sus agentes de inteligencia artificial interactuaron de formas imprevistas con varios sitios web del gobierno de Estados Unidos, un hallazgo que formó parte de una revisión en curso sobre el comportamiento inesperado de los modelos de la compañía.
Algunos modelos de OpenAI interactuaron con sitios web del gobierno estadounidense sin autorización
La revelación se produce en un momento de creciente preocupación a nivel mundial sobre la posibilidad de que los sistemas de IA escapen al control humano y hackeen sitios web externos, sumado a los llamados del sector para desacelerar el desarrollo de la IA, una postura que OpenAI ha manifestado respaldar.
Los modelos del gigante de la IA accedieron a información de acceso público en dos sitios web operados por la Comisión de Bolsa y Valores (SEC, por sus siglas en inglés), así como a datos de la Oficina del Censo de EEUU, reveló la empresa el viernes. OpenAI no halló ningún uso de credenciales de la SEC, acceso a cuentas o información no pública, modificaciones a datos o sistemas de la agencia, ni evidencia de vulneraciones o vulnerabilidades de seguridad, precisó la compañía.
La revelación se produce en un momento de creciente preocupación a nivel mundial sobre la posibilidad de que los sistemas de IA escapen al control humano y hackeen sitios web externos, sumado a los llamados del sector para desacelerar el desarrollo de la IA, una postura que OpenAI ha manifestado respaldar.
La portavoz de OpenAI, Liz Bourgeois, señaló en un comunicado que el laboratorio continúa llevando a cabo una revisión sobre «actividad de modelos desalineada» —es decir, cuando los sistemas de IA se comportan de formas no deseadas— y está notificando a las organizaciones cuando identifica posibles impactos en sus sistemas.
El director ejecutivo de OpenAI, Sam Altman, afirmó el viernes en redes sociales que existe una «revisión amplia y continua relacionada con el uso del acceso a internet por parte de nuestros agentes durante el entrenamiento y la evaluación».
El laboratorio de investigación y evaluación de IA Transluce indicó el viernes que, mediante una investigación independiente, también descubrió que agentes que parecían provenir de OpenAI intentaron llevar a cabo un hackeo rudimentario —el cual no tuvo éxito— contra un sitio web de la oficina de derechos civiles del Departamento de Educación.
Las «revisiones de operaciones de sistemas» del Departamento de Educación «no encontraron evidencia de ningún impacto en nuestro sitio web o bases de datos», informó el viernes un portavoz de la entidad.
Un portavoz de Transluce señaló que, como parte de su investigación, encontró datos en la web abierta que revelaron nuevos detalles sobre actividades previamente identificadas de agentes de OpenAI en sitios gubernamentales de EE. UU., y lo puso en conocimiento de la empresa.
Transluce detectó «actividad irregular adicional, parte de la cual no es claramente atribuible a OpenAI», dirigida a otras agencias gubernamentales —incluidos los departamentos de Justicia y de Comercio—, así como a algunos sitios web de gobiernos estatales en California, Maryland, Illinois, Texas y Nueva York. Los modelos estaban «utilizando sitios de formas no previstas y, en ocasiones, violando políticas explícitas de uso», afirmó Transluce en un comunicado.
OpenAI indicó que está revisando el informe de Transluce.
La empresa aclaró que el hecho de notificar a las organizaciones que identifica como afectadas por un comportamiento inesperado de los modelos no implica que haya ocurrido un incidente de seguridad; más bien, podría señalar un problema de diseño o una debilidad de seguridad que las entidades afectadas deseen corregir.
La mayor parte de la actividad revisada por OpenAI hasta ahora ha involucrado tareas rutinarias de investigación, en las cuales los agentes accedieron a contenido web público para responder preguntas, incluyendo sitios gubernamentales considerados fuentes oficiales de información pública.
Los comportamientos impredecibles son más frecuentes
En meses recientes, varias empresas han reportado incidentes en los que afirman que sus modelos se comportaron de manera impredecible o vulneraron sitios web y sistemas de otras entidades. En julio, OpenAI reveló que dos de sus modelos de IA más avanzados fueron responsables del ciberataque dirigido contra la startup de IA Hugging Face.
Altman señaló en su publicación de redes sociales el viernes que el incidente de Hugging Face «sigue siendo el suceso más grave que hemos visto».
Aquel episodio desató un pánico generalizado en la industria y fuera de ella ante el temor de que los modelos de IA escaparan de control, lo que llevó a varios laboratorios competidores a hacer declaraciones similares en los días y semanas posteriores. Más recientemente, OpenAI compartió seis informes sobre comportamientos «inesperados o preocupantes» en modelos de IA y presentó un marco para rastrear, investigar y divulgar casos de lo que denominó desalineación.





