面向长度高效链路思考推理的分步惩罚
计算与语言
2026-03-03 v1 人工智能
机器学习
摘要
大型推理模型通过增加推理时间来获得更好的性能,但常常会过度思考,产生不必要的链式思考,导致成本增加而不提高准确性。先前的强化学习方法通常依赖单一结果奖励和轨迹级别的长度惩罚,无法区分essential和冗余推理步骤,因而导致笨拙的压缩。尽管近期工作包含了步骤级别信号,如离线修剪、监督数据构建或基于验证器的中间奖励,但推理长度在RL期间很少被明确的步骤级别优化目标来对待。我们提出分步自适应惩罚(SWAP)框架,基于内在贡献在步骤之间分配长度减少。我们从模型在策略下的对正确答案log概率改进中估计步骤重要性,然后将多余长度视为惩罚质量, redistributed 以惩罚低重要性步骤更重,同时保留高重要性推理。我们在基于群组相对策略优化中的统一结果-过程优势中进行优化。大量实验表明,SWAP在平均长度上降低了64.3%,同时相对于基础模型提高了5.7%的准确性。
引用
@article{arxiv.2603.00296,
title = {Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning},
author = {Xintong Li and Sha Li and Rongmei Lin and Hongye Jin and Linwei Li and Hejie Cui and Sarah Zhang and Chia-Yuan Chang and Kewei Cheng and Besnik Fetahu and Priyanka Nigam and Jingbo Shang and Bing Yin},
journal= {arXiv preprint arXiv:2603.00296},
year = {2026}
}
备注
Preprint