Un nuevo proyecto de código abierto llamado ShieldFont ha surgido como respuesta a la práctica generalizada de las empresas de IA que raspan contenido de texto de Internet para entrenar a sus modelos. La iniciativa tiene como objetivo hacer que dicha recopilación de datos sea más difícil al alterar el código subyacente de las páginas web sin afectar la forma en que los lectores humanos perciben el contenido. Este método podría obstaculizar significativamente la capacidad de los raspadores automatizados para recopilar datos de entrenamiento utilizables.
Esta manipulación asegura que los usuarios humanos vean el texto sin cambios, pero los raspadores automatizados encuentran una versión distorsionada. La técnica se basa en la sustitución de palabras con términos no relacionados de la misma categoría gramatical, lo que lleva a oraciones sintácticamente correctas pero semánticamente sin sentido. Por ejemplo, un caballo podría convertirse en una papa, o un líder del gobierno podría transformarse en un gnomos de jardín. Estos cambios alteran el significado del texto, haciéndolo inutilizable para fines de entrenamiento de IA. Las pruebas iniciales han demostrado que este enfoque puede evitar que más del 90 por ciento de las páginas web pasen los filtros de calidad utilizados por los raspadores de IA, bloqueándolos efectivamente para que no se incluyan en los conjuntos de datos de entrenamiento.
Sin embargo, el método no está exento de inconvenientes. Los motores de búsqueda, los lectores de pantalla para usuarios con discapacidad visual, las funciones de copia y pegado y las herramientas de traducción también pueden verse afectados por el HTML alterado, lo que podría reducir la accesibilidad y la usabilidad para los usuarios legítimos. Además, algunos expertos sugieren que los raspadores avanzados podrían eludir ShieldFont al renderizar páginas web enteras en un navegador y extraer texto a través del reconocimiento óptico de caracteres (OCR). Si bien esto haría que la herramienta fuera ineficaz, también aumentaría drásticamente el costo del raspado de datos debido a los recursos computacionales requeridos.
Los creadores de ShieldFont argumentan que el sistema actual permite a los desarrolladores de IA acceder y usar libremente contenido creativo sin permiso, socavando los derechos de los creadores de contenido. Enfatizan que el simple hecho de estar en línea no equivale a dar consentimiento para que el trabajo de uno se use en la capacitación de IA. Su objetivo es introducir fricción en el proceso de recolección de datos, lo que ralentizaría y aumentaría los costos asociados con las operaciones de raspado a gran escala. Si bien el proyecto ha provocado discusiones dentro de la comunidad tecnológica, siguen existiendo diferentes opiniones sobre su efectividad e implicaciones éticas.
Algunos ven a ShieldFont como un paso necesario hacia un mayor control sobre el contenido digital, mientras que otros advierten sobre posibles consecuencias no deseadas para la experiencia del usuario y la accesibilidad.
★
Mantengamos las noticias honestas.
ObjectiveNews se financia con los lectores y no tiene anuncios: te mostramos el sesgo en lugar de ocultarlo. Apoya el periodismo independiente por 4 €/mes.
Hazte suscriptor