Investigadores de ciberseguridad de la empresa Hacktron AI lograron vulnerar sistemas de OpenAI con ayuda del modelo de inteligencia artificial Claude, desarrollado por Anthropic, durante una investigación autorizada para detectar fallas de seguridad.
El caso salió a la luz este viernes y muestra cómo las herramientas de inteligencia artificial pueden ser utilizadas para identificar y explotar vulnerabilidades informáticas con mayor rapidez.
La investigación formaba parte de un programa de seguridad
De acuerdo con los reportes publicados, la actividad fue realizada dentro del programa de recompensas por vulnerabilidades de OpenAI, por lo que los investigadores notificaron a la compañía sobre los fallos encontrados en lugar de utilizar el acceso con fines maliciosos.
Hacktron AI comenzó su investigación a finales de julio y encontró una vulnerabilidad relacionada con el foro comunitario de OpenAI, alojado sobre la plataforma Discourse. A partir de esa falla fue posible construir una cadena de ataque que permitió comprometer cuentas internas.
Claude ayudó a desarrollar el ataque
Los investigadores utilizaron Claude para desarrollar parte del código necesario para explotar las vulnerabilidades.
La investigación permitió acceder a la cuenta de ChatGPT de un empleado de OpenAI y posteriormente alcanzar recursos internos relacionados con los repositorios de código de la compañía. Reportes especializados señalan que también se demostró la posibilidad de interactuar con sistemas internos vinculados con GitHub y Codex.
Los investigadores aseguraron que no descargaron ni examinaron código fuente confidencial. Como prueba de que habían conseguido acceso, realizaron una acción controlada en el repositorio y posteriormente informaron a OpenAI de los hallazgos.
OpenAI corrigió las vulnerabilidades
La compañía confirmó que recibió el reporte de los investigadores y posteriormente implementó medidas para solucionar las vulnerabilidades detectadas.
Según los reportes, Hacktron AI recibió una recompensa de 6 mil 500 dólares por comunicar responsablemente los problemas de seguridad encontrados.
El incidente no significa que Claude haya actuado por cuenta propia para atacar a OpenAI. La operación fue realizada por investigadores humanos que utilizaron el modelo de Anthropic como herramienta dentro de una investigación de seguridad.
Un nuevo reto para la ciberseguridad
El caso vuelve a poner sobre la mesa el creciente papel de la inteligencia artificial en la ciberseguridad. Los modelos actuales pueden ayudar a investigadores a analizar código, localizar vulnerabilidades y desarrollar herramientas para comprobar si una falla puede ser explotada.
Anthropic ha documentado por separado investigaciones en las que sus modelos demostraron capacidades avanzadas para encontrar vulnerabilidades y construir exploits. La empresa también ha advertido sobre los riesgos de proporcionar a los modelos acceso a sistemas y herramientas externas.
El episodio entre Hacktron AI y OpenAI muestra así una nueva realidad en la industria tecnológica: las mismas herramientas de IA que pueden utilizarse para reforzar la seguridad también pueden acelerar las pruebas de penetración y, potencialmente, los ataques informáticos.
¿Qué ocurrió en resumen?
- Hacktron AI investigó sistemas de OpenAI dentro de un programa autorizado.
- Los investigadores utilizaron Claude de Anthropic como apoyo para desarrollar parte del ataque.
- Detectaron una cadena de vulnerabilidades que permitió acceder a cuentas de empleados y recursos internos.
- La investigación llegó hasta repositorios de código de OpenAI.
- Los investigadores reportaron responsablemente los fallos.
- OpenAI corrigió las vulnerabilidades.
- Hacktron AI recibió 6 mil 500 dólares como recompensa.
Redacción





