中文

InT:自提出干预 enables LLM 推理中的信用分配

机器学习 2026-01-21 v1 人工智能 计算与语言

摘要

结果奖励强化学习(RL)在提高大型语言模型(LLM)推理能力方面已被证明有效。然而,标准 RL 仅在最终答案层面分配信用,对错误结果会惩罚整个推理轨迹,对正确结果则均匀强化所有步骤。因此,即使在错误的推理轨迹中,正确的中间步骤也可能被劝 discouraging;而在成功的轨迹中,可能被强化的步骤并非必要。我们称这种失效模式为信用分配问题。虽然训练过程奖励模型是一种自然的补救方法,但准确地优化此类模型以识别纠正性推理步骤仍然具有挑战性。我们引入干预训练(InT),这是一种训练范式,模型通过提出简短、有针对性的纠正来对自身推理轨迹进行细粒度信用分配,从而引导轨迹朝向更高奖励。利用数学推理数据集中常用的参考解,以及验证模型生成解比从头生成正确解更容易的事实,模型识别其推理中首个错误,并提出单步干预以将轨迹重新导向正确解。我们随后对基于误差点之前的 on-policy rollout 进行监督式微调(SFT),将误差局部化到导致失败的具体步骤。我们展示,所得模型是训练 RL 的远优初始化。经过 InT 和随后的 RL 微调后,我们在 IMO-AnswerBench 上相较于 4B 参数基模型提升近 14%,超越更大的开源模型如 gpt-oss-20b。

关键词

引用

@article{arxiv.2601.14209,
  title  = {InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning},
  author = {Matthew Y. R. Yang and Hao Bai and Ian Wu and Gene Yang and Amrith Setlur and Aviral Kumar},
  journal= {arXiv preprint arXiv:2601.14209},
  year   = {2026}
}