中文

基于洞察重放的有状态推理

人工智能 2026-05-19 v2

摘要

思维链推理已成为激发大型语言模型多步推理的基础,但近期研究表明,其收益并不随链长单调增加:虽然更长的 CoT 通常使模型能够处理更难的问题,但在特定问题上,准确率随 CoT 长度增加而上升至某一点后开始下降。我们指出了该现象的一个主要原因:随着 CoT 增长,模型对推理轨迹早期产生的关键洞察的注意力逐渐减弱,导致在最需要这些洞察时愈发难以获取。因此,我们提出 \textbf{InsightReplay},一种有状态推理方法,模型周期性地从其推理轨迹中提取关键洞察,并在活跃生成前沿附近重放它们,使其在推理规模扩大时仍保持可获取性。在 2 ⁣× ⁣3 ⁣× ⁣4\mathbf{2}\!\times\!\mathbf{3}\!\times\!\mathbf{4} 基准测试网格上的大量实验涵盖了模型规模 {8B,30B}\{\text{8B}, \text{30B}\}、模型家族 {Qwen3.5,DeepSeek-R1-Distill-Qwen,Gemma-4}\{\text{Qwen3.5}, \text{DeepSeek-R1-Distill-Qwen}, \text{Gemma-4}\} 以及推理基准 {AIME,HMMT,GPQA Diamond,LiveCodeBench v5}\{\text{AIME}, \text{HMMT}, \text{GPQA Diamond}, \text{LiveCodeBench v5}\},结果表明 3 轮 InsightReplay 在 \textbf{所有 24 项设置} 中均带来准确率提升,相较标准 CoT 平均提升 +1.65\mathbf{+1.65} 分,在 R1-Distill-32B 的 LiveCodeBench v5 子集上单设置最大提升达 +9.2\mathbf{+9.2} 分。我们的结果表明,测试时扩展的有效性不仅取决于模型推理量的多少,还取决于关键中间洞察能否在整个长推理轨迹中保持可获取性。

关键词

引用

@article{arxiv.2605.14457,
  title  = {Stateful Reasoning via Insight Replay},
  author = {Bin Lei and Caiwen Ding and Jiachen Yang and Ang Li and Xin Eric Wang},
  journal= {arXiv preprint arXiv:2605.14457},
  year   = {2026}
}