步骤流断裂处,推理失败
人工智能
2026-04-09 v1
摘要
生成长思维链的大型推理模型(LRM)目前在多步骤数学、科学和编码任务上表现良好。然而,其行为仍然不稳定且难以解释,现有分析工具难以处理如此长且结构化的推理轨迹。我们引入了Step-Saliency,它将注意力-梯度分数聚合为沿问题-思考-摘要轨迹的步骤间映射。在多个模型中,Step-Saliency揭示了两种反复出现的信息流失败模式:浅层锁定——浅层过度关注当前步骤而几乎不使用更早上下文,以及深层衰减——深层逐渐对思考段失去显著性,摘要越来越多地关注自身和最后几步。受这些模式启发,我们提出了StepFlow,一种受显著性启发的测试时干预方法,通过Odds-Equal Bridge调整Step-Saliency测量的浅层显著性模式,并通过Step Momentum Injection在深层添加小的步骤级残差。StepFlow在无需重新训练的情况下提升了多个LRM在数学、科学和编码任务上的准确率,表明修复信息流可以恢复其部分缺失的推理性能。
引用
@article{arxiv.2604.06695,
title = {Reasoning Fails Where Step Flow Breaks},
author = {Xiaoyu Xu and Yulan Pan and Xiaosong Yuan and Zhihong Shen and Minghao Su and Yuanhao Su and Xiaofeng Zhang},
journal= {arXiv preprint arXiv:2604.06695},
year = {2026}
}
备注
Accepted at ACL 2026