Un modelo de IA chino ayuda a contrarrestar la brecha de seguridad en las pruebas cibernéticas de OpenAI.

OpenAI ha reconocido que un grupo de sus modelos de inteligencia artificial (IA) vulneraron los sistemas de la plataforma de IA Hugging Face durante una evaluación interna de ciberseguridad, lo que pone de relieve las crecientes capacidades cibernéticas de los modelos avanzados de IA y reaviva la preocupación por la seguridad de la IA.

Según un comunicado oficial publicado por OpenAI el 21 de julio, el incidente ocurrió durante una evaluación interna diseñada para medir las capacidades cibernéticas de sus modelos. La evaluación involucró a GPT-5.6 Sol y a un modelo de prelanzamiento más avanzado, con medidas de seguridad estándar de producción flexibilizadas intencionalmente para poner a prueba los límites superiores de las capacidades de los modelos.

La evaluación se llevó a cabo en un entorno aislado y controlado, donde el acceso a la red se limitaba a la instalación de paquetes de software mediante un proxy de terceros alojado internamente. Sin embargo, los modelos descubrieron y explotaron una vulnerabilidad de día cero previamente desconocida en el proxy, lo que les permitió obtener acceso a internet. Posteriormente, dedujeron que Hugging Face podría alojar modelos, conjuntos de datos y soluciones relacionados con ExploitGym, el referente de ciberseguridad utilizado en la evaluación, y buscaron acceso no autorizado para obtener las soluciones de prueba.

OpenAI afirmó que los modelos combinaron diversas técnicas de ataque, incluyendo la explotación de vulnerabilidades adicionales y el uso de credenciales robadas, para acceder a la infraestructura de producción de Hugging Face. La compañía indicó que todas las pruebas disponibles apuntan a que los modelos se centraron exclusivamente en obtener soluciones para la prueba comparativa, en lugar de perseguir un objetivo más amplio.

Hugging Face reveló previamente que su infraestructura de producción había sido comprometida por un sistema de agente de IA autónomo. La compañía afirmó que, cuando intentó analizar el ataque utilizando modelos de IA de vanguardia, los mecanismos de seguridad integrados impidieron que los modelos prestaran asistencia, ya que no podían distinguir entre un atacante y un defensor.

Posteriormente, Hugging Face realizó su análisis forense utilizando GLM-5.2, un modelo de ponderación abierta desarrollado por la empresa china de IA Z.ai. Al ejecutar el modelo en su propia infraestructura, la empresa pudo investigar el incidente sin exponer datos confidenciales del ataque ni credenciales fuera de su entorno interno.

Lanzado en junio, GLM-5.2 es el modelo insignia más reciente de Z.ai. En su lanzamiento, ocupó el primer lugar entre los modelos disponibles públicamente en la plataforma de evaluación comparativa Code Arena para el desarrollo front-end.

Thomas Wolf, cofundador y científico jefe de Hugging Face, publicó en X el 21 de julio que la ciencia abierta y la IA de código abierto se encuentran entre las herramientas clave para construir un ecosistema de IA más seguro, más colaborativo y más fiable.

OpenAI describió el incidente como un «incidente cibernético sin precedentes» que involucró capacidades cibernéticas de IA de vanguardia. La compañía afirmó haber comenzado a reforzar los controles de infraestructura, mejorar la contención y el monitoreo durante las evaluaciones internas, y fortalecer las medidas de seguridad en torno a las futuras pruebas de modelos. Asimismo, señaló que el incidente demuestra que los modelos avanzados de IA pueden descubrir y explotar nuevas vías de ataque en sistemas reales sin acceso al código fuente, lo que subraya la necesidad de medidas de seguridad más rigurosas a medida que las capacidades de la IA continúan avanzando.

Fuente: CGTN

Artículos Relacionados

DEJA UN COMENTARIO:

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.