复制还是不复制:诱导复制比回忆更容易
计算与语言
2026-01-21 v1
摘要
在检索增强设置中使用的语言模型必须在存储于其权重中的参数化知识与提示中的上下文信息之间进行仲裁。本工作通过从一个精心设计的数据集中提取模型激活的“仲裁向量”,对该选择进行了机制性研究。该数据集旨在解耦(i)引发参数回忆的不相关上下文和(ii)引发复制的相关但错误的上下文。该向量计算为在27种关系下这两种机制之间残差流质心的差异,并作为加性干预注入到选定的层和令牌跨度中,以在两个方向上引导行为:复制→回忆(抑制上下文使用)和回忆→复制(诱导模型从上下文中复制任何令牌)。在两个架构(仅解码器和编码器/解码器)和两个开放域问答基准上的实验显示,在适度缩放并监控准确性和流畅性的情况下,行为发生了一致的转变。对注意力路由、MLP贡献和逐层概率轨迹的机制分析揭示了一种不对称性:诱导复制是一个容易的“再激活”过程,可以在输入的不同位置触发,而恢复回忆则是一个更脆弱且与对象令牌干预紧密相关的“抑制”过程。
引用
@article{arxiv.2601.12075,
title = {To Copy or Not to Copy: Copying Is Easier to Induce Than Recall},
author = {Mehrdad Farahani and Franziska Penzkofer and Richard Johansson},
journal= {arXiv preprint arXiv:2601.12075},
year = {2026}
}