数据所有者如何说不?Web爬取视觉语言AI训练数据集中数据授权机制的案例研究
计算机与社会
2026-04-10 v3 人工智能
密码学与安全
摘要
互联网已成为训练现代文本到图像或视觉语言模型的主要数据来源,但Web规模数据收集实践是否充分尊重数据所有者的意愿日益不明确。忽略数据所有者对数据用途的授权意见表明,不仅引发伦理问题,最近也引发了关于侵犯版权的诉讼。本文旨在揭示关于数据所有者对AI爬取和训练的授权信息,并研究其在DataComp(包含128亿文本-图像对的流行数据集)中的表达方式。我们检查了样本级别信息,包括版权公告、水印和元数据,以及Web域级别信息,如网站的使用条款(ToS)和机器人排除协议。我们估算至少有1.22亿个样本显示了版权公告的痕迹,其中50个最高频域的60%样本来自包含禁止爬取条款的网站。此外,我们估计在CommonPool中有9-13%的样本(置信区间为95%)包含水印,而现有水印检测方法难以准确捕获它们。我们的全面方法和发现表明,数据所有者依赖多种渠道传递数据授权,而当前的AI数据收集管道并未完全尊重。这些发现凸显了当前数据集精选/发布实践的局限性,以及需要考虑AI用途的统一数据授权框架。
引用
@article{arxiv.2511.08637,
title = {How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets},
author = {Chung Peng Lee and Rachel Hong and Harry H. Jiang and Aster Plotnik and William Agnew and Jamie Morgenstern},
journal= {arXiv preprint arXiv:2511.08637},
year = {2026}
}