El desarrollador chino de inteligencia artificial DeepSeek dijo que gastó 294.000 dólares en entrenar su modelo R1, una cifra mucho menor que las reportadas para sus rivales estadounidenses, en un documento que probablemente reavive el debate sobre el lugar de Pekín en la carrera para desarrollar inteligencia artificial.
La rara actualización de la compañía con sede en Hangzhou (la primera estimación que ha publicado sobre los costos de capacitación del R1) apareció en un artículo revisado por pares en la revista académica Nature publicado el miércoles. El lanzamiento por parte de DeepSeek de lo que dijo eran sistemas de IA de menor costo en enero impulsó a los inversores globales a deshacerse de las acciones tecnológicas, ya que temían que los nuevos modelos pudieran amenazar el dominio de los líderes de IA, incluida Nvidia. Desde entonces, la empresa y su fundador, Liang Wenfeng, han desaparecido en gran medida de la vista del público, salvo para lanzar algunas nuevas actualizaciones de productos.
El artículo de Nature, que incluía a Liang como uno de los coautores, indicó que el modelo R1 de DeepSeek, centrado en el razonamiento, costó 294.000 dólares entrenarlo y utilizó 512 chips Nvidia H800. Una versión anterior del artículo, publicada en enero, no contenía esta información. Sam Altman, director ejecutivo del gigante estadounidense de inteligencia artificial OpenAI, dijo en 2023 que lo que llamó «entrenamiento del modelo fundamental» había costado «mucho más» de 100 millones de dólares, aunque su empresa no ha dado cifras detalladas de ninguno de sus lanzamientos.
Los costos de capacitación de los modelos de lenguaje de gran tamaño que impulsan los chatbots de IA se refieren a los gastos en los que se incurre al ejecutar un grupo de chips potentes durante semanas o meses para procesar grandes cantidades de texto y código. Algunas de las declaraciones de Deepseek sobre sus costos de desarrollo y la tecnología utilizada han sido cuestionadas por empresas y funcionarios estadounidenses. Los chips H800 que mencionó fueron diseñados por Nvidia para el mercado chino después de que en octubre de 2022 Estados Unidos declarara ilegal que la compañía exportara sus chips de inteligencia artificial H100 y A100 más potentes a China.
Funcionarios estadounidenses informaron a Reuters en junio que DeepSeek tiene acceso a «grandes volúmenes» de chips H100 adquiridos tras la implementación de los controles de exportación estadounidenses. Nvidia declaró a Reuters en ese momento que DeepSeek había utilizado chips H800 adquiridos legalmente, no H100. En un documento de información complementaria que acompaña al artículo de Nature, la compañía reconoció por primera vez que posee chips A100 y dijo que los había utilizado en etapas preparatorias de desarrollo.
«En nuestra investigación sobre DeepSeek-R1, utilizamos las GPU A100 para preparar los experimentos con un modelo más pequeño», escribieron los investigadores. Tras esta fase inicial, R1 se entrenó durante un total de 80 horas en el clúster de 512 chips H800, añadieron.
Reuters informó anteriormente que una de las razones por las que DeepSeek pudo atraer a las mentes más brillantes de China fue porque era una de las pocas empresas nacionales que operaba un clúster de supercomputación A100.
Reporte de Eduardo Baptista; Edición de Andrew Heavens
Fuente: reuters

