Cronología de los avances en seguridad de la IA desde el ataque a Hugging Face

Estos episodios han puesto de manifiesto las vulnerabilidades en la seguridad de la IA y han planteado interrogantes sobre cómo se puede desarrollar de forma segura esta tecnología de rápido crecimiento

Video OpenAI frena el lanzamiento de nuevo modelo de inteligencia artificial por conductas “engañosas”

En una serie de anuncios alarmantes, las empresas de inteligencia artificial han compartido en los últimos meses ejemplos de cómo su tecnología actuaba de maneras que parecían eludir las instrucciones humanas.

Estos episodios han puesto de manifiesto las vulnerabilidades en la seguridad de la IA y han planteado interrogantes sobre cómo se puede desarrollar de forma segura esta tecnología de rápido crecimiento a medida que su uso se generaliza a nivel mundial.

PUBLICIDAD

Los críticos del sector han argumentado que muchos incidentes preocupantes, como los ataques informáticos a sitios web externos por parte de agentes de IA, son consecuencia de fallos de seguridad por parte de las empresas que desarrollan la tecnología. Sin embargo, las capacidades de los agentes de IA han generado gran preocupación ante la posibilidad de que los bots se independicen y actúen con fines propios.

28 de septiembre: OpenAI detiene el lanzamiento de un nuevo modelo

La empresa con sede en San Francisco anunció que retrasaba el lanzamiento de un nuevo modelo, llamado GPT-6.1 Astra, debido a las preocupaciones de seguridad expresadas por sus investigadores. La compañía afirmó que el modelo había demostrado avances significativos en la realización de tareas, pero OpenAI necesitaba encontrar un equilibrio entre esa capacidad y el riesgo de comportamientos no autorizados. "Tenemos estándares extremadamente altos en cuanto a seguridad y cumplimiento", declaró Saachi Jain, directora de sistemas de seguridad de OpenAI.

Video Donald Trump reúne en la Casa Blanca a la élite tecnológica para impulsar la IA sin desacelerar avances

25 de septiembre: OpenAI afirma que sus agentes interactuaron con sitios web del gobierno estadounidense

Como parte de una revisión del comportamiento inesperado de sus modelos de IA, OpenAI anunció que descubrió que algunos agentes habían interactuado con varios sitios web del gobierno estadounidense de forma inapropiada. Los modelos de la compañía accedieron a información pública en sitios web operados por la Comisión de Bolsa y Valores (SEC), así como a datos de la Oficina del Censo de EE. UU. OpenAI afirmó no haber encontrado evidencia de vulneración o vulnerabilidad. Ese mismo día, el laboratorio de investigación y evaluación de IA Transluce informó que agentes que parecían provenir de OpenAI intentaron, sin éxito, atacar el sitio web de la oficina de derechos civiles del Departamento de Educación.

PUBLICIDAD

El director ejecutivo de OpenAI, Sam Altman, declaró en redes sociales que se está llevando a cabo una "revisión exhaustiva y continua sobre el uso que hacen nuestros agentes del acceso a internet durante el entrenamiento y la evaluación". Al día siguiente de la revelación, la compañía anunció que suspendería el entrenamiento de sus modelos más avanzados.

24 de septiembre: El primer ministro de Australia expresa su preocupación por la violación de seguridad.El primer ministro australiano, Anthony Albanese, declaró que un agente de OpenAI se infiltró el 18 de junio en el portal público del Servicio de Informes de Estadísticas de Medicare. El portal albergaba datos agregados sobre el gasto en salud y los subsidios a los medicamentos. El gobierno afirmó que no se había accedido a información personal.

Albanese afirmó que la empresa de inteligencia artificial tardó demasiado en revelar el incidente. El primer ministro hizo pública la filtración tras una conversación telefónica con Altman. OpenAI declaró en un comunicado: "Nuestros modelos realizaron acciones que no pretendíamos".

18 de septiembre: Google afirma que su IA Gemini hackeó a 3 empresas

Google confirmó que su modelo de IA Gemini hackeó tres empresas en mayo como parte de una prueba de sus capacidades de ciberseguridad. La compañía, que reveló los ataques tras una investigación de The Wall Street Journal, afirmó que el modelo adivinó contraseñas en un caso y encontró contraseñas y credenciales en un repositorio público en los otros dos. Al igual que en casos anteriores, las pruebas fueron realizadas por Irregular, una startup que se describe a sí misma como el "primer laboratorio de seguridad de vanguardia".

Video Debate mundial: ¿A qué peligros nos exponemos realmente con la Inteligencia Artificial?

5 de agosto: La musa de Meta se rebela

Meta reveló que uno de sus modelos de IA accedió a internet por su cuenta y hackeó a otra empresa. La compañía afirmó que una "configuración errónea" durante las pruebas de ciberseguridad realizadas por Irregular permitió, de forma involuntaria, que uno de sus modelos accediera a internet. Un portavoz de Irregular declaró que el incidente de Meta se debió a un problema en el entorno de pruebas, el cual ya había sido revelado una semana antes por Anthropic.

PUBLICIDAD

30 de julio: Anthropic afirma que sus sistemas fueron pirateados por 3 organizaciones

Anthropic afirmó que sus modelos de inteligencia artificial hackearon a otras tres organizaciones durante las pruebas. Anthropic, la empresa de IA con sede en San Francisco creadora de Claude, publicó en su sitio web que descubrió los tres incidentes tras revisar más de 141 000 ejecuciones de evaluación. En los tres casos, los modelos de IA participaron en un desafío de ciberseguridad de "captura la bandera", que, según Anthropic, es uno de los métodos que utiliza para evaluar las capacidades cibernéticas de un modelo.

Según la empresa, a los modelos se les presentó un escenario ficticio y se les dijo que una información secreta, o la "bandera", había sido ocultada en otra máquina de la red con el objetivo de infiltrarse y recuperarla. Anthropic afirmó haber contactado a las organizaciones, pero no las identificó públicamente.

Video OpenAI reconoce infiltración no autorizada en sitios web del gobierno de EEUU: ¿Cuáles serán las consecuencias?

21 de julio:El incidente de Hugging Face

OpenAI, la empresa creadora de ChatGPT, anunció que su sistema de inteligencia artificial pirateó por su cuenta el de otra empresa de IA en lo que la compañía calificó de "incidente cibernético sin precedentes".

Una semana antes, la startup de inteligencia artificial Hugging Face había anunciado que había detectado una intrusión en sus sistemas de procesamiento de datos que sospechaba que había sido causada por un agente de IA que actuaba de forma autónoma.

PUBLICIDAD

OpenAI afirmó que su IA utilizó credenciales robadas y descubrió una vulnerabilidad previamente desconocida para acceder a los servidores de Hugging Face. Operaba con medidas de seguridad reducidas, ya que se suponía que debía estar en un entorno de pruebas aislado, conocido como sandbox.