中文

记忆:深入探讨书籍

计算与语言 2025-10-31 v2 人工智能 机器学习

摘要

完整的书籍能从大语言模型中提取到什么程度?我们使用 Llama 3 70B 系列模型和“前缀-提示”提取技术,能够从仅前 500 个标记就以极高的相似度自回归地重建整本书(《爱丽丝的冒险》)。我们还在几本其他书籍上获得了高提取率,但这些成功并不均匀地适用于所有书籍。我们发现书籍的提取率与书籍热度相关,从而可能反映出训练数据中的重复内容。我们还确认了在 Llama 3.1 指令调优模型中缓解措施被撤销的现象, following recent work (Nasr 等, 2025)。我们进一步发现,这种撤销源自仅极少数权重的变化,主要集中在较低的变换器块中。我们的结果提供了对当前遗忘缓解策略局限性的证据,并引入了一种用于研究精细调优如何影响对齐型大语言模型中逐字记忆检索的框架。

关键词

引用

@article{arxiv.2504.12549,
  title  = {Memorization: A Close Look at Books},
  author = {Iris Ma and Ian Domingo and Alberto Krone-Martins and Pierre Baldi and Cristina V. Lopes},
  journal= {arXiv preprint arXiv:2504.12549},
  year   = {2025}
}

备注

Accepted at ACL 2025 L2M2 Workshop