高性能大语言模型能否伦理?量化网页爬虫 Opt-Out 的影响
计算与语言
2025-08-06 v2 机器学习
摘要
随着网页爬虫 opt-out 被版权持有者广泛采用,关于数据合规对大语言模型(LLM)性能影响的质疑日益突出。然而,如何这些限制(以及随之而来的预训练数据集过滤)影响使用这些语料训练的模型能力,仍鲜有了解。本文将这种效应概念化为“数据合规间隙”(DCG),以量化在遵守网页爬虫 opt-out 要求的语料集上训练的模型与不遵守要求的语料集上训练的模型之间的性能差异。我们在两种设置下测量数据合规间隙:一种是从头预训练模型,另一种是从现有的合规模型进行持续预训练(模拟稍后在预训练过程中整合受版权保护数据的情形)。我们的实验使用 15B 参数模型,显示截至 2025 年 1 月,遵守网页数据 opt-out 要求并未损害通用知识获取能力(接近 0% DCG)。然而,在生物医学等专业领域,排除主要出版社会导致性能下降。这些发现表明,虽然可以用完全开放数据训练出在一般任务上性能相当的通用 LLM,但在专业领域可能从后期预训练中获取高质量版权源数据中受益。我们提供的实证研究为长期以来的争论——数据合规与下游模型性能之间的权衡——提供了见解,为未来的 AI 训练实践和政策决策提供了信息。我们的网站地址为 https://data-compliance.github.io/。
关键词
引用
@article{arxiv.2504.06219,
title = {Can Performant LLMs Be Ethical? Quantifying the Impact of Web Crawling Opt-Outs},
author = {Dongyang Fan and Vinko Sabolčec and Matin Ansaripour and Ayush Kumar Tarun and Martin Jaggi and Antoine Bosselut and Imanol Schlag},
journal= {arXiv preprint arXiv:2504.06219},
year = {2025}
}
备注
COLM 2025 Camera Ready version