Manifold-Guided Attention Steering(注意力引导式转向)
机器学习
2026-05-22 v1
摘要
大型语言模型在推理任务中经常会产生错误,尽管它们拥有正确推理所必需的底层知识。改进推理一致性的一个可能方法是通过激活转向。然而,现有的激活转向方法应用固定的、预计算的校正向量,忽视模型当前在生成轨迹中的位置;结果是对已经正确的步骤和错误的步骤一样随意地进行扰动。我们提出了 Manifold-Guided Attention Steering (MAGS),这是一种基于几何观察的轨迹感知推理时干预方法:特定注意力头的输出激活在错误发生点偏离低维正确流形,而这一偏离会在后续步骤中累积。对于每个被识别的注意力头,我们从正确和错误轨迹的对比对中学习低维子空间,捕捉错误行为偏离正确行为方向的特征。在推理过程中,我们监控每个头与该流形的距离,并在偏离超过学习阈值时施加针对性的投影校正,将注意力输出引导回正确的子空间,防止错误的传播。MAGS 在涵盖数学推理 (MATH-500、GSM8K)、代码生成 (HumanEval、MBPP) 和分子生成 (SMILES) 的基准测试中一致优于无转向基线和静态转向方法,表明正确流形是 LLM 注意力几何的通用特征。
引用
@article{arxiv.2605.21770,
title = {Manifold-Guided Attention Steering},
author = {Ian Li and Kapilesh Guruprasad and Raunak Sengupta and Ninad Satish and Loris D'Antoni and Rose Yu},
journal= {arXiv preprint arXiv:2605.21770},
year = {2026}
}