重新思考大语言模型中记忆度量及其影响
机器学习
2025-07-22 v1
摘要
关注隐私威胁,记忆在LLM中常被视为不可取的,尤其是在学习方面。本文我们研究记忆是否可以在优化学习语言时避免,以及记忆所带来的隐私威胁是否被放大。为此,我们重新审视现有的以隐私为重点的记忆度量,即基于回忆的记忆和反事实记忆,以及新提出的情境记忆。将记忆与学习中的局部过拟合相关联,情境记忆旨在使记忆与LLM的情境学习能力相分离。形式上,如果由于训练而导致的回忆超过学习的最佳情境回忆——这一表示在不训练的情况下实现最佳情境学习的学习阈值——则该字符串被认为是情境记忆的。概念上,情境回忆避免了基于回忆的记忆谬误,即任何形式的高回忆都是记忆的标志。理论上,情境记忆与反事实记忆相关,但施加更严格的条件。记忆度量在结果和信息需求方面存在差异。在我们对18个来自6个家族的LLM以及多个不同熵的正式语言进行实验后,我们显示(a)记忆度量在不同频繁字符串的记忆顺序上存在分歧, (b)学习语言的最优方式无法避免对训练字符串的部分记忆, (c)改进的学习会降低情境记忆和反事实记忆,但会增加基于回忆的记忆。最后,(d)我们重新审视了已报告的回忆记忆字符串,这些字符串既不构成隐私威胁,也不属于情境记忆或反事实记忆。
引用
@article{arxiv.2507.14777,
title = {Rethinking Memorization Measures and their Implications in Large Language Models},
author = {Bishwamittra Ghosh and Soumi Das and Qinyuan Wu and Mohammad Aflah Khan and Krishna P. Gummadi and Evimaria Terzi and Deepak Garg},
journal= {arXiv preprint arXiv:2507.14777},
year = {2025}
}
备注
Preprint