中文

超越频率:冗余在大语言模型记忆中的作用

机器学习 2025-09-01 v2 人工智能

摘要

大语言模型中的记忆化对隐私和公平性构成关键风险,因为这些系统已扩展至数十亿参数。虽然先前研究建立了记忆化与诸如令牌频率和重复模式等因素之间的相关性,但我们揭示了不同的响应模式:频率对已记忆样本的影响极小(例如 0.09),而对未记忆样本的影响显著(例如 0.25),这一规律在不同模型规模下保持一致。通过扰动样本前缀并进行反事实分析,利用令牌位置变化量化扰动强度,我们证明了冗余性与记忆化模式之间的关联。我们的发现表明:约 79% 的已记忆样本为低冗余样本,这些低冗余样本的脆弱性是高冗余样本的 2 倍,因此已记忆样本在扰动下下降 0.6,而未记忆样本仅下降 0.01,表明冗余度更高的内容既更易被记忆也更脆弱。这些发现表明了潜在的冗余引导方法可用于数据预处理,从而降低隐私风险并缓解偏差,以确保模型部署中的公平性。

关键词

引用

@article{arxiv.2506.12321,
  title  = {Beyond Frequency: The Role of Redundancy in Large Language Model Memorization},
  author = {Jie Zhang and Qinghua Zhao and Chi-ho Lin and Zhongfeng Kang and Lei Li},
  journal= {arXiv preprint arXiv:2506.12321},
  year   = {2025}
}

备注

8 figures