注意力闭合:LLM 在多轮交互中丢失线索的机制分析
人工智能
2026-05-14 v1 计算与语言
摘要
大型语言模型在单轮中能够遵循复杂指令,但在长期多轮交互中常丢失指令、人格和规则的线索。这种退化行为已被行为方式衡量,但尚未得到机制解释。我们提出一种信道-转换模型:目标定义 token 通过注意力变得更难以访问,而相关信息可能保留在残差表示中。我们引入目标可访问性比率(Goal Accessibility Ratio, GAR),衡量生成 token 对任务定义目标 token 的注意力,并结合滑动窗口消融实验和残差流探针。当对指令的注意力关闭时,残差中保存的揭示了模型的架构特征。跨模型而言,该转换导致定性不同的失效模式:一些模型在注意力消失时保持目标条件化行为,另一些模型即便残差中可解码的目标信息也会失败,编码出现的层次在 2 到 27 之间变化。对 Mistral 模型进行的内部因果消融实验,在注意力信道被强制关闭后,20 事实记忆任务的召回率从接近完美降至 11%,且在无用户压力下的对抗性压力基线中,人格约束违规率上升至显著水平,这两者效应在可预见的转换轮次中出现。线性探针可从残差表示中恢复每回合的召回结果,AUC 最高可达 0.99,而输入嵌入保持在随机水平。跨模型和模型规模而言,注意力丢失与残差可解码性之间的差距预测了目标条件化行为在信道关闭后是否存活。我们贡献了 GAR 作为诊断工具、信道-转换框架作为受控的机制解释模型,以及在窗口注意力关闭情形下预测失效时机的函数式预测。
引用
@article{arxiv.2605.12922,
title = {When Attention Closes: How LLMs Lose the Thread in Multi-Turn Interaction},
author = {Vardhan Dongre and Joseph Hsieh and Viet Dac Lai and Seunghyun Yoon and Trung Bui and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2605.12922},
year = {2026}
}