中文

超越公共访问:LLM 预训练数据中的隐私研究

计算与语言 2026-05-07 v2 人工智能

摘要

我们使用获取合法的 34 本 O'Reilly Media 版权图书数据集,应用 DE-COP 成员推断攻击方法,调查 OpenAI 大语言模型是否显示对受版权保护内容的识别。基于此小样本,我们的结果表明,OpenAI 的最新且更强大的模型 GPT-4o 表现出与识别付费墙图书内容一致的模式,AUROC 为 0.82(95% bootstrap 置信区间:0.60-0.96),尽管这一宽广置信区间反映了由于测试的图书数量有限导致的重大不确定性。GPT-4o Mini 作为一个更小的模型,对任何 O'Reilly Media 内容的识别都很有限,其非公共数据的 AUROC 为 0.56(0.28-0.83)。测试多个模型、使用相同截止日期,为潜在语言变化随时间变化可能偏向我们的发现提供了部分控制,尽管模型规模、架构以及可能的训练数据组成差异限制了该控制的强度。这些初步结果凸显了增加企业透明度关于预训练数据来源的重要性,以及为 AI 内容训练开发正式授权框架的必要性。我们的主要贡献在于分别考察了公共和非公共数据。

关键词

引用

@article{arxiv.2505.00020,
  title  = {Beyond Public Access in LLM Pre-Training Data},
  author = {Sruly Rosenblat and Tim O'Reilly and Ilan Strauss},
  journal= {arXiv preprint arXiv:2505.00020},
  year   = {2026}
}

备注

29 pages, 4 figures. Revised based on peer review comments. Added bootstrapped 95% CIs for all AUROC scores and z-tests comparing public vs. non-public recognition (new Table 3). Qualified claims where differences are not statistically significant at book level. Updated contact information