中文

注意力揭示LLM推理:Preplan-and-Anchor节奏实现细粒度策略优化

计算与语言 2025-10-16 v1 机器学习

摘要

大语言模型(LLMs)的推理模式仍不透明,强化学习(RL)通常在整个生成过程中均匀分配信用,模糊了关键步骤与常规步骤之间的区别。本工作将注意力定位为使LLMs内部逻辑可见的特权基质,不仅是计算的副产品,更是推理本身的机制性蓝图。我们首先区分注意力头之间的局部和全局信息处理,发现局部注意力头在对角线附近产生锯齿形模式,指示短语块,而全局注意力头暴露对后续token具有广泛影响的token。我们用两种指标formalized这些现象:1)窗口化平均注意力距离,衡量在限定窗口内的后向注意力范围;2)未来注意力影响,衡量token全局重要性作为其接收来自后续token的平均注意力。综合这些信号,我们发现一种反复出现的preplan-and-anchor机制,即模型首先进行长程上下文参考以生成介绍性token,随后立即或与之 coincide的语义锚点token组织后续推理。利用这些洞见,我们引入三个新的RL策略,动态对关键节点(plan token, anchor token及其时间耦合)进行有针对性的信用分配,显示出在各种推理任务中一致的性能提升。通过将优化与模型内在推理节奏一致,我们旨在将不透明的优化转化为可操作的结构感知过程,希望为更透明和有效的LLM推理优化提供一步可能的进展。

关键词

引用

@article{arxiv.2510.13554,
  title  = {Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization},
  author = {Yang Li and Zhichen Dong and Yuhan Sun and Weixun Wang and Shaopan Xiong and Yijia Luo and Jiashun Liu and Han Lu and Jiamang Wang and Wenbo Su and Bo Zheng and Junchi Yan},
  journal= {arXiv preprint arXiv:2510.13554},
  year   = {2025}
}

备注

23 pages, 8 figures, 5 tables