Meta utilizó libros con derechos de autor para el entrenamiento de IA a pesar de las advertencias de sus propios abogados, alegan los autores

Los abogados de Meta Platforms le habían advertido sobre los peligros legales de utilizar miles de libros pirateados para entrenar sus modelos de inteligencia artificial, pero la compañía lo hizo de todos modos, según un nuevo documento publicado en una demanda por infracción de derechos de autor presentada inicialmente este verano.

La nueva presentación del lunes por la noche consolida dos demandas presentadas contra el propietario de Facebook e Instagram por la comediante Sarah Silverman, el ganador del Premio Pulitzer Michael Chabon y otros autores destacados, quienes alegan que Meta ha utilizado sus obras sin permiso para entrenar su modelo de lenguaje de inteligencia artificial. , Llama.

El mes pasado, un juez de California desestimó parte de la demanda de Silverman e indicó que daría permiso a los autores para modificar sus afirmaciones.

Meta no respondió de inmediato a una solicitud de comentarios sobre las acusaciones.

La nueva denuncia, presentada el lunes, incluye registros de chat de un investigador afiliado a Meta que discute la adquisición del conjunto de datos en un servidor de Discord, una prueba potencialmente significativa que indica que Meta era consciente de que su uso de los libros podría no estar protegido por Estados Unidos. ley de derechos de autor.

En los registros de chat citados en la denuncia, el investigador Tim Dettmers describe sus idas y venidas con el departamento legal de Meta sobre si el uso de los archivos del libro como datos de entrenamiento sería «legalmente correcto».

«En Facebook, hay muchas personas interesadas en trabajar con (L)he (P)ile, incluyéndome a mí, pero en su forma actual, no podemos usarlo por razones legales», escribió Dettmers en 2021, refiriéndose a un conjunto de datos que Meta ha reconocido haber utilizado para entrenar su primera versión de Llama, según la denuncia.

El mes anterior, Dettmers escribió que los abogados de Meta le habían dicho que «los datos no se pueden utilizar o los modelos no se pueden publicar si están capacitados con esos datos», según la denuncia.

Si bien Dettmers no describe las preocupaciones de los abogados, sus homólogos en el chat identifican «libros con derechos de autor activos» como la mayor fuente probable de preocupación. Dicen que la capacitación sobre los datos debería «caer bajo el uso legítimo», una doctrina legal estadounidense que protege ciertos usos sin licencia de obras protegidas por derechos de autor.

Dettmers, estudiante de doctorado de la Universidad de Washington, dijo a Reuters que no podía comentar de inmediato sobre las afirmaciones.

Las empresas tecnológicas se han enfrentado este año a una serie de demandas por parte de creadores de contenido que las acusan de estafar obras protegidas por derechos de autor para construir modelos generativos de inteligencia artificial que han creado sensación global y han estimulado un frenesí de inversiones.

Si tienen éxito, esos casos podrían frenar la moda de la IA generativa, ya que podrían aumentar el costo de construir modelos ávidos de datos al obligar a las empresas de IA a compensar a los artistas, autores y otros creadores de contenido por el uso de sus obras.

Al mismo tiempo, las nuevas normas provisionales en Europa que regulan la inteligencia artificial podrían obligar a las empresas a revelar los datos que utilizan para entrenar sus modelos, exponiéndolas potencialmente a más riesgos legales.

Meta lanzó una primera versión de su modelo de lenguaje grande Llama en febrero y publicó una lista de conjuntos de datos utilizados para el entrenamiento, incluida «la sección Books3 de ThePile». La persona que reunió ese conjunto de datos ha dicho en otro lugar que contiene 196.640 libros, según la denuncia.

La compañía no reveló datos de entrenamiento para su última versión del modelo, Llama 2, que puso a disposición para uso comercial este verano.

Llama 2 es de uso gratuito para empresas con menos de 700 millones de usuarios activos mensuales. Su lanzamiento fue visto en el sector tecnológico como un potencial cambio de juego en el mercado del software de IA generativa, amenazando con alterar el dominio de jugadores como OpenAI y Google, que cobran por el uso de sus modelos.

Informe de Katie Paul en Nueva York Editado por Kenneth Li y Matthew Lewis

Fuente: reuters

Artículos Relacionados

DEJA UN COMENTARIO:

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.