Meta presenta el modelo de IA más grande de Llama 3, promocionando avances en lenguaje y matemáticas

Meta Platforms lanzó el martes la versión más grande de sus modelos de inteligencia artificial Llama 3, en su mayoría gratuitos, que cuentan con habilidades multilingües y métricas de rendimiento generales que siguen los pasos de los modelos pagos de rivales como OpenAI.
El nuevo modelo Llama 3 puede conversar en ocho idiomas, escribir código informático de mayor calidad y resolver problemas matemáticos más complejos que las versiones anteriores, afirmó la empresa matriz de Facebook en publicaciones de blog y un documento de investigación anunciando el lanzamiento.
Con 405 mil millones de parámetros, o variables que el algoritmo tiene en cuenta para generar respuestas a las consultas de los usuarios, eclipsa a la versión anterior lanzada el año pasado, aunque sigue siendo más pequeño que los modelos líderes ofrecidos por los competidores.
Por el contrario, se informa que el modelo GPT-4 de OpenAI tiene un billón de parámetros y Amazon está preparando un modelo con 2 billones de parámetros. Al promocionar Llama 3 en varios canales, el director ejecutivo Mark Zuckerberg dijo que esperaba que los futuros modelos de Llama superaran a los competidores propietarios el próximo año.
El chatbot Meta AI impulsado por esos modelos estaba en camino de convertirse en el asistente de inteligencia artificial más popular para fines de este año, con cientos de millones de personas que ya lo usan, dijo. El lanzamiento se produce en un momento en que las empresas de tecnología se apresuran a demostrar que sus crecientes carteras de modelos de lenguajes de gran tamaño que consumen muchos recursos pueden ofrecer ganancias suficientemente significativas en áreas problemáticas conocidas, como el razonamiento avanzado, para justificar las gigantescas sumas que se han invertido en ellos.
El propio científico de IA más importante de Meta ha dicho que cree que dichos modelos se toparán con límites en el razonamiento y que se necesitarán otros tipos de sistemas de IA para producir avances. Además de su modelo estrella de 405 mil millones de parámetros, Meta también está lanzando versiones actualizadas de sus modelos más livianos Llama 3 de 8 mil millones y 70 mil millones de parámetros, presentados inicialmente en la primavera , dijo la compañía. Los tres nuevos modelos son multilingües y pueden manejar solicitudes de usuarios más grandes a través de una «ventana de contexto» ampliada, lo que según el jefe de IA generativa de Meta, Ahmad Al-Dahle, mejoraría la experiencia de generación de código informático en particular.
«Esa fue la respuesta número uno que recibimos de la comunidad», dijo Al-Dahle a Reuters en una entrevista, señalando que las ventanas de contexto más grandes dan a los modelos algo parecido a una memoria más larga que ayuda a procesar solicitudes de varios pasos.
Por otra parte, Al-Dahle dijo que su equipo había podido mejorar el desempeño del modelo Llama 3 en tareas como resolver problemas matemáticos mediante el uso de IA para generar algunos de los datos en los que fueron entrenados.
Meta lanza sus modelos Llama de forma prácticamente gratuita para que los utilicen los desarrolladores, una estrategia que según Zuckerberg dará sus frutos en forma de productos innovadores, una menor dependencia de posibles competidores y una mayor participación en las principales redes sociales de la empresa. Sin embargo, algunos inversores han mostrado su desconfianza ante los costes que ello implica. La empresa también se beneficiará si los desarrolladores optan por utilizar sus modelos gratuitos en lugar de los de pago, lo que debilitaría los modelos comerciales de sus rivales. Con su anuncio, Meta promocionó mejoras en pruebas clave de matemáticas y conocimientos que pueden hacer que esa perspectiva sea más atractiva.
Aunque medir el progreso en el desarrollo de IA es notoriamente difícil, los resultados de pruebas proporcionados por Meta parecieron sugerir que su modelo más grande, Llama 3, casi igualaba y en algunos casos superaba al Claude 3.5 Sonnet de Anthropic y al GPT-4o de OpenAI, que son ampliamente considerados como los dos modelos de frontera más poderosos del mercado. En la prueba de referencia MATH de problemas matemáticos de nivel competitivo, por ejemplo, el modelo de Meta obtuvo una puntuación de 73,8, en comparación con el 76,6 de GPT-4o y el 71,1 de Claude 3.5 Sonnet.
El modelo obtuvo una puntuación de 88,6 en MMLU, un punto de referencia que cubre docenas de materias en matemáticas, ciencias y humanidades, mientras que GPT-4o obtuvo una puntuación de 88,7 y Claude 3.5 Sonnet obtuvo una puntuación de 88,3. En su artículo, los investigadores de Meta también adelantaron las próximas versiones «multimodales» de los modelos que se lanzarán a finales de este año y que superpondrán capacidades de imagen, video y voz al modelo de texto central de Llama 3. Los primeros experimentos indican que esos modelos pueden funcionar de forma «competitiva» con otros modelos multimodales como Gemini 1.5 de Google y Claude 3.5 Sonnet de Anthropic, dijeron.
Reporte de Katie Paul; editado por Louise Heavens y Daniel Wallis
Fuente: reuters

Artículos Relacionados

DEJA UN COMENTARIO:

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.