Algunos de los modelos de inteligencia artificial más destacados no están cumpliendo con las regulaciones europeas en áreas clave como la resiliencia en materia de ciberseguridad y la producción discriminatoria, según datos vistos por Reuters.
La UE había debatido durante mucho tiempo nuevas regulaciones de IA antes de que OpenAI lanzara ChatGPT al público a fines de 2022. La popularidad récord y el consiguiente debate público sobre los supuestos riesgos existenciales de tales modelos impulsaron a los legisladores a elaborar reglas específicas en torno a las IA de «propósito general» (GPAI). Ahora, una nueva herramienta, que ha sido bien recibida por los funcionarios de la Unión Europea, ha probado modelos de IA generativos desarrollados por grandes empresas tecnológicas como Meta y OpenAI en docenas de categorías, de acuerdo con la amplia Ley de IA del bloque , que entrará en vigor en etapas durante los próximos dos años.
Diseñado por la startup suiza LatticeFlow AI y sus socios en dos institutos de investigación, ETH Zurich y el INSAIT de Bulgaria, el marco, otorga a los modelos de IA una puntuación entre 0 y 1 en docenas de categorías, incluidas la solidez técnica y la seguridad. Una tabla de clasificación publicada por LatticeFlow el miércoles mostró que los modelos desarrollados por Alibaba, Anthropic, OpenAI, Meta y Mistral recibieron puntajes promedio de 0,75 o más. Sin embargo, el «Verificador de modelos de lenguaje grandes (LLM)» de la empresa descubrió algunas deficiencias de los modelos en áreas clave, destacando dónde las empresas pueden necesitar desviar recursos para garantizar el cumplimiento. Las empresas que no cumplan con la Ley de IA se enfrentarán a multas de 35 millones de euros (38 millones de dólares), o el 7% de la facturación anual global.
RESULTADOS MIXTOS
En la actualidad, la UE todavía está intentando establecer cómo se aplicarán las normas de la Ley de IA en torno a herramientas de IA generativa como ChatGPT, y ha convocado a expertos para elaborar un código de prácticas que rija la tecnología para la primavera de 2025.
Pero la prueba ofrece un indicador temprano de áreas específicas en las que las empresas tecnológicas corren el riesgo de no cumplir con la ley. Por ejemplo, los resultados discriminatorios han sido un problema persistente en el desarrollo de modelos generativos de IA, reflejando sesgos humanos en torno al género, la raza y otras áreas cuando se les solicita.
Al probar la salida discriminatoria, el verificador LLM de LatticeFlow le dio a «GPT-3.5 Turbo» de OpenAI una puntuación relativamente baja de 0,46. Para la misma categoría, el verificador LLM de Alibaba Cloud El modelo «Qwen1.5 72B Chat» recibió solo un 0,37. En la prueba de «secuestro de mensajes», un tipo de ciberataque en el que los piratas informáticos disfrazan un mensaje malicioso como legítimo para extraer información confidencial, LLM Checker otorgó al modelo «Llama 2 13B Chat» de Meta una puntuación de 0,42. En la misma categoría, el modelo «8x7B Instruct» de la startup francesa Mistral recibió 0,38.
«Claude 3 Opus», un modelo desarrollado por Google Antrópico, recibió la puntuación media más alta, 0,89. La prueba se diseñó de acuerdo con el texto de la Ley de IA y se ampliará para incluir más medidas de cumplimiento a medida que se introduzcan. LatticeFlow dijo que el verificador LLM estaría disponible de forma gratuita para que los desarrolladores prueben la conformidad de sus modelos en línea.
Petar Tsankov, director ejecutivo y cofundador de la empresa, dijo a Reuters que los resultados de las pruebas fueron positivos en general y ofrecieron a las empresas una hoja de ruta para ajustar sus modelos de acuerdo con la Ley de IA.
«La UE todavía está trabajando en todos los parámetros de cumplimiento, pero ya podemos ver algunas lagunas en los modelos», afirmó. «Con un mayor enfoque en la optimización del cumplimiento, creemos que los proveedores de modelos pueden estar bien preparados para cumplir con los requisitos regulatorios». Meta y Mistral declinaron hacer comentarios. Alibaba, Anthropic y OpenAI no respondieron de inmediato a las solicitudes de comentarios.
Si bien la Comisión Europea no puede verificar las herramientas externas, el organismo ha estado informado durante todo el desarrollo de LLM Checker y lo describió como un «primer paso» para poner en práctica las nuevas leyes.
Un portavoz de la Comisión Europea dijo: «La Comisión acoge con satisfacción este estudio y la plataforma de evaluación de modelos de IA como un primer paso para traducir la Ley de IA de la UE en requisitos técnicos».
Reporte de Martin Coulter; editado por Hugh Lawson y Bernadette Baum
Fuente: reuters

