Llama See, Llama Do:大语言模型中上下文牵引与分心的机制视角
计算与语言
2025-06-30 v2
摘要
我们在广泛的语言模型(LM)和提示设置中观察到了一种新现象——上下文牵引(contextual entrainment),为 LM 如何被输入提示中的“无关”上下文信息所分心提供了新的机制视角。具体而言,LM 会为上下文提示中先前出现过的任何 token 分配显著更高的 logits(或概率),即使是随机 token 亦如此。这表明上下文牵引是一种机制性现象,其发生独立于 token 与问题或句子其余部分的相关性或语义关系。我们发现了具有统计显著性的证据,表明上下文牵引的程度受语义因素影响。与事实性提示相比,反事实性提示具有更大的影响,这表明尽管上下文牵引是一种机制性现象,但它受语义因素的调节。我们假设存在一个注意力头电路——即牵引头(entrainment heads)——与上下文牵引现象相对应。使用一种基于可微掩码的新型牵引头发现方法,我们在各种设置下识别了这些头。当我们“关闭”这些头(即将其输出设为零)时,上下文牵引的效应显著减弱,导致模型生成的输出回归至未提供干扰上下文时所产生的结果。我们对上下文牵引的发现,以及对经由牵引头探究 LM 分心问题的研究,标志着在分心问题的机制分析与缓解方面迈出了关键一步。
引用
@article{arxiv.2505.09338,
title = {Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMs},
author = {Jingcheng Niu and Xingdi Yuan and Tong Wang and Hamidreza Saghir and Amir H. Abdi},
journal= {arXiv preprint arXiv:2505.09338},
year = {2025}
}
备注
ACL 2025