中文

隐私问题的公共池:大规模网络抓取机器学习数据集的法律与技术教训

密码学与安全 2026-04-08 v2 计算机与社会

摘要

我们调查了用于训练AI系统的网络抓取数据的内容,其规模之大使得人类数据集策展人和编译者无法再手动标注每个样本。基于先前对机器学习模型中隐私问题的关注,我们提出疑问:网络抓取的机器学习数据集的法律隐私影响是什么?在对一个流行的训练数据集进行的实证研究中,我们发现尽管进行了清理工作,但个人身份信息仍然大量存在。我们的审计提供了具体证据,支持任何大规模网络抓取数据集都可能包含法律定义的个人数据这一担忧。我们利用这些来自真实世界数据集的发现,为我们在现有隐私和数据保护法方面的法律分析提供信息。我们揭示了当前数据策展实践的各种法律风险,这些实践可能会传播个人信息以训练下游模型。基于我们的实证和法律分析,我们主张重新定位当前“公开可用”信息的框架,以有意义地限制基于对互联网不加区分抓取而构建的AI的发展。

关键词

引用

@article{arxiv.2506.17185,
  title  = {A Common Pool of Privacy Problems: Legal and Technical Lessons from a Large-Scale Web-Scraped Machine Learning Dataset},
  author = {Rachel Hong and Jevan Hutson and William Agnew and Imaad Huda and Tadayoshi Kohno and Jamie Morgenstern},
  journal= {arXiv preprint arXiv:2506.17185},
  year   = {2026}
}