Reddit actualizará el estándar web para bloquear el raspado automático de sitios web

Plataforma de redes sociales Reddit dijo el martes que actualizará un estándar web utilizado por la plataforma para bloquear la extracción automatizada de datos de su sitio web, luego de informes de que las nuevas empresas de inteligencia artificial estaban eludiendo la regla para recopilar contenido para sus sistemas.
La medida llega en un momento en que las empresas de inteligencia artificial han sido acusadas de plagiar contenido de los editores para crear resúmenes generados por IA sin dar crédito ni pedir permiso. Reddit dijo que actualizaría el Protocolo de exclusión de robots, o «robots.txt», un estándar ampliamente aceptado destinado a determinar qué partes de un sitio pueden rastrearse. La compañía también dijo que mantendrá la limitación de velocidad, una técnica utilizada para controlar la cantidad de solicitudes de una entidad en particular, y bloqueará a robots y rastreadores desconocidos para que no puedan extraer datos (recopilar y guardar información sin procesar) en su sitio web.
Más recientemente, robots.txt se ha convertido en una herramienta clave que los editores emplean para evitar que las empresas de tecnología utilicen su contenido de forma gratuita para entrenar algoritmos de inteligencia artificial y crear resúmenes en respuesta a algunas consultas de búsqueda. La semana pasada , una carta a los editores enviada por la startup de licencias de contenido TollBit decía que varias empresas de inteligencia artificial estaban eludiendo el estándar web para eliminar los sitios de los editores. Esto sigue a una investigación de Wired,que descubrió que Perplexity, la startup de búsqueda de inteligencia artificial, probablemente eludió los esfuerzos para bloquear su rastreador web a través de robots.txt.
A principios de junio, la editorial de medios empresariales Forbes acusó, Perplejidad por plagiar sus historias de investigación para usarlas en sistemas de inteligencia artificial generativa sin dar crédito. Reddit dijo el martes que investigadores y organizaciones como Internet Archive seguirán teniendo acceso a su contenido para uso no comercial.
Reporte de Harshita Mary Varghese; editado por Alan Barona
Fuente: reuters

Artículos Relacionados

DEJA UN COMENTARIO:

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.