提示回声:LLM 推理中的概率成本与注意力重聚
计算与语言
2026-02-09 v1
摘要
大规模推理模型 (LRM) 中的测试时计算分配广泛应用,具有数学问题求解、代码合成和规划等应用。最近的工作通过扩展自我一致性和并行思考,添加通用“思考 token”并要求模型在回答前重新阅读问题,来解决此问题。不幸的是,这些方法要么注入任务无关的 token,要么强加不解释且常常忽略模型在其内部链条开头常见的自发重复现象。相反,我们分析并利用模型对问题的重述倾向,这被我们称为提示回声 (Echo of Prompt, EOP),作为前置的、影响计算的机制。我们通过将回声移除建模为基于拒绝的条件化,定义回声概率间隙 作为可计算的代理,从而为回声的概率成本提供了理论依据。这一理论框架建立了早期重复与概率收益及下游准确性之间的联系。然而,它本身并不指定如何利用 EOP。因此,我们发展了 \emph{Echo-Distilled SFT (ED-SFT)} 通过监督微调来培育“回声-然后-推理”模式,以及 \emph{Echoic Prompting (EP)} 在追踪中重新聚焦注意力。尽管已具备前景,但超出冗长性的量化效益并不容易。因此,我们进行了长度和后缀控制的概率分析,结合层级注意力研究,表明 EOP 增加了中间层中答案到答案前缀的注意力,符合注意力重聚机制。我们在 GSM8K、MathQA、Hendrycks-MATH、AIME24 和 MATH-500 上进行评估,保持相同的解码设置和预算,发现各基线方法都获得了持续的性能提升。代码已公开于 https://github.com/hhh2210/echoes-as-anchors。
引用
@article{arxiv.2602.06600,
title = {Echoes as Anchors: Probabilistic Costs and Attention Refocusing in LLM Reasoning},
author = {Zhuoyuan Hao and Zhuo Li and Wu Li and Fangming Liu and Min Zhang and Jing Li},
journal= {arXiv preprint arXiv:2602.06600},
year = {2026}
}