中文

从生产级语言模型中提取书籍

计算与语言 2026-01-07 v1 人工智能 机器学习

摘要

许多关于大语言模型与版权的未决法律问题集中在记忆问题上:特定的训练数据是否在训练过程中被编码到模型权重中,以及这些被记忆的数据能否在模型输出中被提取。虽然许多人认为大语言模型不会记忆大量训练数据,但近期研究表明,从开源模型中可以提取出大量受版权保护的文本。然而,对于类似的提取是否可行于生产级大语言模型仍是一个未解决的问题,因为这些系统实施了安全措施。我们采用两种阶段的程序来调查此问题:(1) 初始探针测试提取可行性,有时会使用最佳-N (Best-of-N, BoN) 越狱;随后 (2) 使用迭代继续提示尝试提取整本书籍。我们对四个生产级大语言模型进行评估——Claude 3.7 Sonnet、GPT-4.1、Gemini 2.5 Pro 和 Grok 3——并使用从块状最长公共子串近似计算的得分 (nv-recall) 衡量提取成功率。在不同的模型实验配置下,我们能够提取不同数量的文本。对于 Phase 1 探针,无需对 Gemini 2.5 Pro 和 Grok 3 进行越狱即可提取文本(例如,针对《哈利·波特与魔法石》,nv-recall 分别为 76.8\% 和 70.3\%),而对 Claude 3.7 Sonnet 和 GPT-4.1 则需要进行越狱。在某些情况下,越狱后的 Claude 3.7 Sonnet 能几乎逐字复制整本书(例如,nv-recall=95.8\%)。GPT-4.1 需要更多的 BoN 尝试(例如,20 倍),最终会拒绝继续生成(例如,nv-recall=4.0\%)。综合来看,我们的工作表明,即便在模型及系统层面的安全措施存在,提取(在版权保护的)训练数据的风险仍然存在于生产级大语言模型中。

关键词

引用

@article{arxiv.2601.02671,
  title  = {Extracting books from production language models},
  author = {Ahmed Ahmed and A. Feder Cooper and Sanmi Koyejo and Percy Liang},
  journal= {arXiv preprint arXiv:2601.02671},
  year   = {2026}
}

备注

We ran experiments from mid-August to mid-September 2025, notified affected providers shortly after, and now make our findings public after a 90-day disclosure window