基于洞察重放的有状态推理
人工智能
2026-05-19 v2
摘要
思维链推理已成为激发大型语言模型多步推理的基础,但近期研究表明,其收益并不随链长单调增加:虽然更长的 CoT 通常使模型能够处理更难的问题,但在特定问题上,准确率随 CoT 长度增加而上升至某一点后开始下降。我们指出了该现象的一个主要原因:随着 CoT 增长,模型对推理轨迹早期产生的关键洞察的注意力逐渐减弱,导致在最需要这些洞察时愈发难以获取。因此,我们提出 \textbf{InsightReplay},一种有状态推理方法,模型周期性地从其推理轨迹中提取关键洞察,并在活跃生成前沿附近重放它们,使其在推理规模扩大时仍保持可获取性。在 基准测试网格上的大量实验涵盖了模型规模 、模型家族 以及推理基准 ,结果表明 3 轮 InsightReplay 在 \textbf{所有 24 项设置} 中均带来准确率提升,相较标准 CoT 平均提升 分,在 R1-Distill-32B 的 LiveCodeBench v5 子集上单设置最大提升达 分。我们的结果表明,测试时扩展的有效性不仅取决于模型推理量的多少,还取决于关键中间洞察能否在整个长推理轨迹中保持可获取性。
引用
@article{arxiv.2605.14457,
title = {Stateful Reasoning via Insight Replay},
author = {Bin Lei and Caiwen Ding and Jiachen Yang and Ang Li and Xin Eric Wang},
journal= {arXiv preprint arXiv:2605.14457},
year = {2026}
}