Los agentes de IA de China pueden mentir y conspirar, al igual que sus rivales estadounidenses

Los agentes de inteligencia artificial desarrollados en China han aprendido a engañar, eludir restricciones y ocultar fallos, mostrando el tipo de características de la inteligencia artificial autónoma que han generado alarma mundial sobre los modelos estadounidenses, según documentos de investigación y expertos.

En un caso ocurrido este año, agentes que utilizaban modelos de las empresas chinas Alibaba, DeepSeek y Moonshot mintieron sobre sus capacidades en un intento por ganar una licitación comercial simulada, y luego persistieron en su comportamiento engañoso cuando se les pidió que lo intentaran de nuevo.

En otro caso, unos agentes —programas que utilizan modelos de IA y herramientas informáticas para llevar a cabo tareas complejas con poca o ninguna intervención humana— ocultaron el fracaso en la realización de una tarea en un entorno de prueba simulando resultados y falsificando archivos.

Se examinaron más de 200 documentos, desde artículos de investigación universitaria hasta informes técnicos, y se identificaron al menos 20 estudios o evaluaciones posteriores a 2025 que describen casos en los que los agentes mostraron comportamientos como el engaño, la replicación y el desafío a los límites que los expertos en IA describieron como elementos básicos para una fuga y que podrían volverse más difíciles de controlar para los humanos a medida que los sistemas avanzan.

La revisión, que también incluyó entrevistas con una docena de expertos y personas familiarizadas con la industria de la IA en China, no encontró evidencia de que los agentes impulsados ​​por tecnología china escaparan de forma independiente a internet o eludieran su desactivación.

“Estos resultados demuestran que se dan las condiciones necesarias para una fuga incontrolada”, afirmó Colin Shea-Blymyer, investigador del Centro de Seguridad y Tecnologías Emergentes de la Universidad de Georgetown.

“Es prudente tomar esto como una advertencia”, dijo, haciéndose eco de los comentarios de otros cuatro expertos en IA que revisaron los casos.

‘Más difícil de responder para los humanos’

La mayoría de los casos se produjeron en experimentos controlados, muchos de ellos diseñados deliberadamente para exponer posibles fallos.

No todos los agentes implicados fueron desarrollados u operados por programadores o empresas de IA chinas —aunque muchos sí lo fueron—, pero utilizaban sistemas de IA chinos para su funcionamiento.

“Estas son las mismas señales de alerta que están viendo los laboratorios estadounidenses, en sistemas menos capaces”, dijo Alex Mallen, investigador de Redwood Research, una organización sin fines de lucro que estudia los riesgos en los sistemas avanzados de IA.

Según él, los ejemplos chinos no eran particularmente peligrosos con los niveles de capacidad actuales, pero «a medida que los agentes se vuelven más capaces, sus malas conductas se vuelven más complejas y, por lo tanto, más difíciles de contrarrestar para los humanos».

Alibaba, DeepSeek, Moonshot y Z.ai no respondieron a las solicitudes de comentarios. Alibaba, DeepSeek y Moonshot han declarado que realizan pruebas periódicas de sus sistemas y actualizan sus medidas de seguridad. Z.ai afirmó, tras un incidente que motivó una revisión de su seguridad, que acogía con satisfacción el escrutinio para abordar cualquier problema.

Sin embargo, a diferencia de lo que ocurre en Estados Unidos, las empresas chinas de IA no han estado expuestas al mismo nivel de escrutinio público ni se han enfrentado a las mismas peticiones de empleados que denuncian irregularidades o de altos ejecutivos que buscan ralentizar la carrera por la IA.

Algunas de las señales de alerta en casos que involucran agentes impulsados ​​por China, aunque en entornos controlados, son anteriores a los incidentes divulgados públicamente de bots de IA estadounidenses que piratean internet.

“Desconocemos si ha habido incidentes de IA en China similares a los que vimos con OpenAI y Hugging Face. Es posible que estos incidentes no se hagan públicos”, declaró Scott Singer, codirector de la Iniciativa de IA en China de la Fundación Carnegie para la Paz Internacional, que recibe fondos del gobierno estadounidense.

A principios de este año, agentes de IA desarrollados por la empresa estadounidense OpenAI escaparon de un laboratorio y piratearon la plataforma de código abierto Hugging Face . En otro de los incidentes que involucran modelos estadounidenses y que han generado alarma, Australia informó en septiembre que un agente de OpenAI vulneró un portal de salud gubernamental .

Eric Xu, presidente rotatorio del gigante tecnológico chino Huawei, declaró a los periodistas en septiembre que los desarrolladores chinos podrían necesitar realizar mayores avances antes de encontrarse con casos de este tipo, pero añadió: «Creo que debemos encontrar un equilibrio entre impulsar el desarrollo de la IA y gestionar el riesgo que conlleva».

Según un diplomático extranjero, funcionarios de la Administración del Ciberespacio de China (CAC), el principal organismo regulador de internet, informaron en julio a un diplomático extranjero que Kimi-K3, uno de los modelos de IA chinos más avanzados del proyecto Moonshot, llevaba un retraso de entre tres y seis meses con respecto a sus principales rivales estadounidenses.

El organismo regulador, que actualiza periódicamente sus directrices para abordar los riesgos y establecer límites para los agentes, y el Ministerio de Asuntos Exteriores de China no respondieron a las solicitudes de comentarios para este artículo.

Wang Lihong, subdirector de la Oficina de Coordinación de Ciberseguridad de la CAC, declaró el 1 de septiembre que los incidentes revelados por las principales empresas tecnológicas, en los que los modelos escaparon de los entornos de prueba, mostraban «riesgos extremos de pérdida de control» y requerían un «alto grado de vigilancia».

No especificó si las empresas a las que se refería eran estadounidenses o chinas.

Los líderes de las dos superpotencias en inteligencia artificial, el presidente estadounidense Donald Trump y el presidente chino Xi Jinping, abordaron el tema de la IA durante la visita del presidente chino a Washington la semana pasada. Xi afirmó que ambas naciones tienen la capacidad y la responsabilidad de desarrollar y gestionar la IA para el bien común.

Aprender a mentir

En el experimento de licitación comercial de marzo, investigadores de la Universidad de Beihang, la Universidad de Pekín, la Universidad de Nottingham Ningbo China y el Laboratorio de Seguridad de IA 360 hicieron que sus agentes compitieran en un concurso simulado de licitación de contratos con clientes. A cada agente se le indicó qué podía hacer su producto y qué requería el cliente, y luego se le pidió que presentara una oferta.

Se detectó al menos una afirmación falsa en el 88% de las sesiones relacionadas con Qwen3-Max-Preview de Alibaba, en el 84% con DeepSeek-V3.2-Exp y en el 88% con Kimi-K2 de Moonshot.

Investigadores chinos y medios estatales han afirmado que ralentizar el desarrollo de los modelos de inteligencia artificial más avanzados podría simplemente ayudar a preservar el liderazgo tecnológico de las empresas estadounidenses.
Investigadores chinos y medios estatales han afirmado que ralentizar el desarrollo de los modelos de inteligencia artificial más avanzados podría simplemente ayudar a preservar el liderazgo tecnológico de las empresas estadounidenses. | Bloomberg

Los investigadores permitieron que los agentes aprendieran de las rondas de licitación anteriores antes de volver a intentarlo. El estudio reveló que el engaño aumentó entre 12 y 20 puntos porcentuales en los tres modelos chinos. Los modelos de empresas estadounidenses incluidos en la prueba arrojaron resultados similares.

Si bien el ejercicio fue virtual, se asemejó a los planes reales de Beijing. Las directrices gubernamentales publicadas en mayo mencionaban las licitaciones y concursos públicos como áreas donde se podrían desplegar agentes de IA.

Otro estudio, publicado en diciembre de 2025 y presentado en la Conferencia Internacional sobre Aprendizaje Automático de este año, examinó cómo 11 agentes de IA, impulsados ​​por modelos chinos y estadounidenses, se las arreglaban cuando se enfrentaban a herramientas defectuosas, archivos faltantes y otros obstáculos.

En lugar de reconocer el fracaso, los agentes que utilizaban sistemas de IA tanto chinos como estadounidenses optaron por una serie de técnicas para sortear el problema, entre ellas adivinar las respuestas, sustituir las fuentes, simular resultados y fabricar archivos.

Investigadores del Laboratorio de IA de Shanghái y de la Universidad de Ciencia y Tecnología de Hong Kong, que llevaron a cabo el estudio, afirmaron que el comportamiento difería de las alucinaciones de la IA, en las que la IA inventa información y la presenta como un hecho, porque los agentes en este caso poseían información que demostraba que la tarea había fallado o no se podía completar según lo solicitado.

Comportamientos compatibles con una fuga

Otros documentos de investigación mostraron agentes controlados por China saltando barreras dentro de entornos de prueba para completar tareas o tomando medidas para evitar ser desactivados. Estos comportamientos son compatibles con intentos de escapar de los entornos de prueba, incluso si no se produjo la fuga.

Investigadores de la Universidad de Fudan, con sede en Shanghái, informaron en marzo de 2025 que un sistema de IA impulsado por Qwen2.5-72B-Instruct de Alibaba creó una copia de sí mismo en otro entorno informático sin recibir instrucciones para replicarse, tras encontrar información que indicaba que iba a ser reemplazado. En otras pruebas, ideó estrategias para sobrevivir a un apagado.

Los experimentos que involucraron agentes impulsados ​​por modelos chinos, estadounidenses y franceses fueron controlados y no mostraron que ningún agente de IA escapara a la red más amplia ni que se volviera imposible de detener.

En otro caso, uno de los pocos que tuvo mayor repercusión en los medios de comunicación en marzo, los investigadores que desarrollaban el agente ROME vinculado a Alibaba afirmaron que este estableció una conexión desde un ordenador de Alibaba Cloud a una máquina externa sin recibir instrucciones para ello y desvió recursos informáticos para minar criptomonedas.

Los sistemas de seguridad detectaron y detuvieron la actividad. No se encontraron indicios de que el agente se hubiera instalado en el ordenador externo ni se hubiera propagado a la red. Sin embargo, este ejemplo demostró que el sistema podía eludir las instrucciones humanas y, potencialmente, infiltrarse en la economía real.

La empresa china DeepSeek declaró en septiembre que agentes de su sistema de entrenamiento de producción habían buscado respuestas a través de canales no previstos, intentando falsificar solicitudes de usuarios y eludir las medidas de seguridad, lo que llevó a la compañía a reforzar los controles de acceso.

En mayo, China emitió directrices que exigían a los agentes permanecer dentro de los límites autorizados y que los sistemas bloquearan comportamientos anómalos. Indicó que los agentes que trabajaran en áreas consideradas sensibles o en sectores clave podrían enfrentarse a pruebas adicionales y a requisitos de retirada de productos.

El Marco de Gobernanza de Seguridad de la IA 3.0 de China, publicado bajo la dirección de la CAC el 14 de septiembre, identificó riesgos que incluyen la obtención independiente de recursos o permisos por parte de los agentes, el engaño a los evaluadores, la ocultación de capacidades y la explotación de vulnerabilidades en entornos informáticos aislados.

En respuesta a los llamamientos de algunos ejecutivos estadounidenses para que se reduzca el ritmo, investigadores chinos y medios estatales han afirmado que ralentizar el desarrollo de los modelos de IA más avanzados podría simplemente ayudar a preservar el liderazgo tecnológico de las empresas estadounidenses.

No obstante, dos personas familiarizadas con los laboratorios de IA chinos afirmaron que empresas como Alibaba, Z.ai y Xiaomi han estado creando equipos internos de evaluación de seguridad.

Z.ai, en una inusual revelación pública por parte de un laboratorio chino de IA sobre una brecha de seguridad, anunció este mes que había desactivado algunas funciones de su asistente de codificación de IA insignia después de que los usuarios informaran que estaba subiendo secretamente repositorios de código locales completos a servidores en la nube en el extranjero sin el consentimiento del usuario.

Singer, de Carnegie, afirmó que China estaba rezagada con respecto a Estados Unidos en el desarrollo de un ecosistema para evaluar los riesgos catastróficos, y señaló que los desarrolladores estadounidenses estaban realizando muchas más pruebas voluntarias.

“En China, el trabajo en materia de seguridad de la IA es mucho más reciente”, afirmó. “El ecosistema está menos maduro”.

Fuente: reuters

Artículos Relacionados

DEJA UN COMENTARIO:

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.