猜测还是回忆?用于分类和局部化LLM中记忆的CNN训练方法
计算与语言
2025-11-14 v2
摘要
大型语言模型(LLM)中的逐字记忆是一种多层面的现象,涉及不同的底层机制。我们引入一种新方法来分析现有分类所描述的不同记忆形式。具体而言,我们对LLM的注意力权重训练卷积神经网络(CNN),并评估该分类与解码过程中涉及的注意力权重之间的对齐程度。我们发现现有分类表现不佳,无法反映注意力块内的不同机制。我们提出了一种新的分类,通过最大化与注意力权重的对齐来实现,包括三个类别:使用语言建模能力猜测的记忆样本、因训练集中高重复性而被回忆的记忆样本,以及非记忆样本。我们的结果表明,少数逐字记忆并不对应于特定的注意力机制。我们也显示,显著比例的可提取样本实际上是由模型猜测的,因而应单独研究。最后,我们开发了一种自定义可视化可解释性技术,用于局部化每种记忆形式涉及的注意力权重区域。
引用
@article{arxiv.2508.02573,
title = {Guess or Recall? Training CNNs to Classify and Localize Memorization in LLMs},
author = {Jérémie Dentan and Davide Buscaldi and Sonia Vanier},
journal= {arXiv preprint arXiv:2508.02573},
year = {2025}
}
备注
This paper has been accepted for publication at AAAI-26