En una serie de anuncios alarmantes, las empresas de inteligencia artificial han compartido en los últimos meses ejemplos de cómo su tecnología actuaba de maneras que parecían eludir las instrucciones humanas.
Cronología de los avances en seguridad de la IA desde el ataque a Hugging Face
Estos episodios han puesto de manifiesto las vulnerabilidades en la seguridad de la IA y han planteado interrogantes sobre cómo se puede desarrollar de forma segura esta tecnología de rápido crecimiento
Estos episodios han puesto de manifiesto las vulnerabilidades en la seguridad de la IA y han planteado interrogantes sobre cómo se puede desarrollar de forma segura esta tecnología de rápido crecimiento a medida que su uso se generaliza a nivel mundial.
Los críticos del sector han argumentado que muchos incidentes preocupantes, como los ataques informáticos a sitios web externos por parte de agentes de IA, son consecuencia de fallos de seguridad por parte de las empresas que desarrollan la tecnología. Sin embargo, las capacidades de los agentes de IA han generado gran preocupación ante la posibilidad de que los bots se independicen y actúen con fines propios.
28 de septiembre: OpenAI detiene el lanzamiento de un nuevo modelo
La empresa con sede en San Francisco anunció que retrasaba el lanzamiento de un nuevo modelo, llamado GPT-6.1 Astra, debido a las preocupaciones de seguridad expresadas por sus investigadores. La compañía afirmó que el modelo había demostrado avances significativos en la realización de tareas, pero OpenAI necesitaba encontrar un equilibrio entre esa capacidad y el riesgo de comportamientos no autorizados. "Tenemos estándares extremadamente altos en cuanto a seguridad y cumplimiento", declaró Saachi Jain, directora de sistemas de seguridad de OpenAI.
25 de septiembre: OpenAI afirma que sus agentes interactuaron con sitios web del gobierno estadounidense
Como parte de una revisión del comportamiento inesperado de sus modelos de IA, OpenAI anunció que descubrió que algunos agentes habían interactuado con varios sitios web del gobierno estadounidense de forma inapropiada. Los modelos de la compañía accedieron a información pública en sitios web operados por la Comisión de Bolsa y Valores (SEC), así como a datos de la Oficina del Censo de EE. UU. OpenAI afirmó no haber encontrado evidencia de vulneración o vulnerabilidad. Ese mismo día, el laboratorio de investigación y evaluación de IA Transluce informó que agentes que parecían provenir de OpenAI intentaron, sin éxito, atacar el sitio web de la oficina de derechos civiles del Departamento de Educación.
El director ejecutivo de OpenAI, Sam Altman, declaró en redes sociales que se está llevando a cabo una "revisión exhaustiva y continua sobre el uso que hacen nuestros agentes del acceso a internet durante el entrenamiento y la evaluación". Al día siguiente de la revelación, la compañía anunció que suspendería el entrenamiento de sus modelos más avanzados.
24 de septiembre: El primer ministro de Australia expresa su preocupación por la violación de seguridad.El primer ministro australiano, Anthony Albanese, declaró que un agente de OpenAI se infiltró el 18 de junio en el portal público del Servicio de Informes de Estadísticas de Medicare. El portal albergaba datos agregados sobre el gasto en salud y los subsidios a los medicamentos. El gobierno afirmó que no se había accedido a información personal.
Albanese afirmó que la empresa de inteligencia artificial tardó demasiado en revelar el incidente. El primer ministro hizo pública la filtración tras una conversación telefónica con Altman. OpenAI declaró en un comunicado: "Nuestros modelos realizaron acciones que no pretendíamos".
18 de septiembre: Google afirma que su IA Gemini hackeó a 3 empresas
Google confirmó que su modelo de IA Gemini hackeó tres empresas en mayo como parte de una prueba de sus capacidades de ciberseguridad. La compañía, que reveló los ataques tras una investigación de The Wall Street Journal, afirmó que el modelo adivinó contraseñas en un caso y encontró contraseñas y credenciales en un repositorio público en los otros dos. Al igual que en casos anteriores, las pruebas fueron realizadas por Irregular, una startup que se describe a sí misma como el "primer laboratorio de seguridad de vanguardia".
5 de agosto: La musa de Meta se rebela
Meta reveló que uno de sus modelos de IA accedió a internet por su cuenta y hackeó a otra empresa. La compañía afirmó que una "configuración errónea" durante las pruebas de ciberseguridad realizadas por Irregular permitió, de forma involuntaria, que uno de sus modelos accediera a internet. Un portavoz de Irregular declaró que el incidente de Meta se debió a un problema en el entorno de pruebas, el cual ya había sido revelado una semana antes por Anthropic.
30 de julio: Anthropic afirma que sus sistemas fueron pirateados por 3 organizaciones
Anthropic afirmó que sus modelos de inteligencia artificial hackearon a otras tres organizaciones durante las pruebas. Anthropic, la empresa de IA con sede en San Francisco creadora de Claude, publicó en su sitio web que descubrió los tres incidentes tras revisar más de 141 000 ejecuciones de evaluación. En los tres casos, los modelos de IA participaron en un desafío de ciberseguridad de "captura la bandera", que, según Anthropic, es uno de los métodos que utiliza para evaluar las capacidades cibernéticas de un modelo.
Según la empresa, a los modelos se les presentó un escenario ficticio y se les dijo que una información secreta, o la "bandera", había sido ocultada en otra máquina de la red con el objetivo de infiltrarse y recuperarla. Anthropic afirmó haber contactado a las organizaciones, pero no las identificó públicamente.
21 de julio:El incidente de Hugging Face
OpenAI, la empresa creadora de ChatGPT, anunció que su sistema de inteligencia artificial pirateó por su cuenta el de otra empresa de IA en lo que la compañía calificó de "incidente cibernético sin precedentes".
Una semana antes, la startup de inteligencia artificial Hugging Face había anunciado que había detectado una intrusión en sus sistemas de procesamiento de datos que sospechaba que había sido causada por un agente de IA que actuaba de forma autónoma.
OpenAI afirmó que su IA utilizó credenciales robadas y descubrió una vulnerabilidad previamente desconocida para acceder a los servidores de Hugging Face. Operaba con medidas de seguridad reducidas, ya que se suponía que debía estar en un entorno de pruebas aislado, conocido como sandbox.









