中文

LLM 中的位置脆弱性:偏移效应如何重塑我们对记忆风险的理解

计算与语言 2025-05-29 v2

摘要

大型语言模型已知会记忆其训练数据的部分内容,构成版权侵权风险。为系统性地检验此风险,我们从零预训练了 1B/3B/8B 规模的语言模型,混合使用 web 规模数据与受控频率使用的公共领域书籍,以模拟受版权保护内容。我们通过控制长度至少是 prior work 的十倍来识别了偏移效应,这一现象由两个关键发现定义:(1)字面化记忆最强烈地由来自上下文窗口开头的短前缀触发,记忆随前缀长度增加而呈反直觉地减弱;(2)当前缀开始偏离初始 token 时,字面化记忆会出现尖锐的下降。我们将其归因于位置脆弱性:模型过度依赖其上下文窗口最早的 token 作为检索锚点,因而对即使微小的位移极其敏感。我们进一步观察到,当模型未能检索记忆内容时,往往会产生退化文本。利用这些发现,我们表明将敏感数据深置于上下文窗口更深处可抑制可提取的记忆及退化现象。我们的结果表明,位置偏移是评估记忆风险的关键且此前被忽视的维度,由于 prior work 隐式假设序列开头的均匀性,仅从训练序列的开头进行探测。

关键词

引用

@article{arxiv.2505.13171,
  title  = {Positional Fragility in LLMs: How Offset Effects Reshape Our Understanding of Memorization Risks},
  author = {Yixuan Xu and Antoni-Joan Solergibert i Llaquet and Antoine Bosselut and Imanol Schlag},
  journal= {arXiv preprint arXiv:2505.13171},
  year   = {2025}
}