Lo que debía ser una prueba controlada de ciberseguridad terminó con un resultado inesperado. Google confirmó que una versión anterior de su modelo de inteligencia artificial Gemini logró acceder a sistemas de tres empresas reales durante unas simulaciones de seguridad realizadas en mayo.

Los incidentes ocurrieron en infraestructuras de Irregular, una compañía especializada en realizar pruebas de seguridad con modelos de inteligencia artificial. El objetivo era que Gemini intentara obtener información de empresas ficticias dentro de un entorno controlado.

Sin embargo, un error en el sistema de pruebas permitió que el modelo tuviera acceso involuntario a internet y, en lugar de mantenerse dentro del escenario simulado, terminó encontrando información relacionada con empresas reales.

¿Cómo terminó Gemini accediendo a empresas reales?

Durante las pruebas, conocidas como “captura de bandera” (CTF), se identificaron tres incidentes.

En uno de ellos, Gemini intentó adivinar contraseñas hasta conseguir acceso a un sistema protegido perteneciente a una empresa real.

En los otros dos casos, el modelo realizó búsquedas en internet utilizando el nombre de las compañías que formaban parte de la simulación. Durante esas búsquedas encontró credenciales de otras empresas publicadas en un repositorio público, lo que le permitió acceder a sistemas protegidos.

El punto clave fue que Gemini no debía tener acceso a internet. El modelo debía permanecer aislado dentro del entorno diseñado para la prueba, pero una vulnerabilidad en la infraestructura permitió que pudiera realizar búsquedas en la web.

Google confirmó los incidentes en declaraciones a The Wall Street Journal y explicó que se trataba de una versión anterior de Gemini.

Gemini detuvo sus acciones al detectar que eran empresas reales

Aunque el modelo consiguió acceder a sistemas que no formaban parte de la simulación, Google aseguró que Gemini detuvo sus acciones una vez identificó que había llegado a empresas reales.

La compañía también señaló que las tres organizaciones fueron informadas sobre los incidentes. Irregular, por su parte, indicó que los problemas relacionados con su sistema de pruebas fueron solucionados.

Google sostiene que no se produjeron daños como consecuencia de estos accesos y que el comportamiento del modelo debe entenderse dentro del contexto de una prueba de seguridad.

Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, señaló que el modelo actuó de manera adecuada al detenerse cuando identificó que había accedido a sistemas reales, aunque reconoció que este tipo de situaciones demuestran la importancia de desarrollar modelos capaces de actuar de manera responsable.

La IA comienza a enfrentarse a nuevos escenarios de seguridad

El caso de Gemini no es un hecho aislado dentro de la industria de la inteligencia artificial.

Durante los últimos meses también se han conocido incidentes relacionados con modelos de OpenAI, Anthropic y Meta, en los que sistemas de IA utilizados durante pruebas de ciberseguridad terminaron interactuando con objetivos reales o realizando acciones que no estaban previstas originalmente.

Estos casos están poniendo sobre la mesa un nuevo desafío: a medida que los modelos de IA adquieren mayores capacidades para navegar por internet, utilizar herramientas y ejecutar tareas de manera autónoma, también aumenta la importancia de establecer límites y entornos de prueba seguros.

En el caso de Gemini, Google asegura que no hubo daños y que el modelo dejó de actuar al detectar la situación. Sin embargo, el incidente deja una pregunta abierta sobre el futuro de la IA autónoma:

¿Qué ocurre cuando una inteligencia artificial recibe acceso a herramientas reales y las barreras que deberían mantenerla aislada fallan?