SinkTrack:基于注意力沉底的大语言模型上下文锚定
计算机视觉与模式识别
2026-05-19 v2
摘要
大语言模型 (LLM) 常出现幻觉和上下文遗忘现象。先前研究表明,注意力漂移是这些问题的主要原因,即 LLM 生成新 token 时注意力从初始输入上下文转移。为此,我们利用 LLM 的一种内在特性:注意力沉底 —— 模型倾向于持续分配高注意力给序列第一个 token (<BOS>)。具体而言,我们提出一种先进的上下文锚定方法 SinkTrack,将 <BOS> 视为信息锚点,将关键上下文特征(如来自输入图像或指令)注入其表征中。如此一来,LLM 在整个生成过程中始终保持对初始输入上下文的锚定。SinkTrack 无需训练、即插即用,且引入的推理开销极小。实验表明,SinkTrack 在文本任务(如 Llama3.1-8B-Instruct 上 SQuAD2.0 提升 21.6%)和多模态任务(如 Qwen2.5-VL-7B-Instruct 上 M3CoT 提升 22.8%)上均能显著缓解幻觉和上下文遗忘。其在不同架构和规模上的一致性提升凸显了方法的鲁棒性和可泛化性。我们还从信息传递视角分析了其背后的工作机制。我们的源码已公开于 https://github.com/67L1/SinkTrack。
引用
@article{arxiv.2604.10027,
title = {SinkTrack: Attention Sink based Context Anchoring for Large Language Models},
author = {Xu Liu and Guikun Chen and Wenguan Wang},
journal= {arXiv preprint arXiv:2604.10027},
year = {2026}
}
备注
ICLR 2026. Code: https://github.com/67L1/SinkTrack