中文

ETR: 用于高效思维链推理的熵趋势奖励

人工智能 2026-04-08 v1 计算与语言

摘要

思维链(CoT)推理提升了大语言模型在复杂任务上的性能,但往往产生过长且低效的推理轨迹。现有方法通过长度惩罚或全局熵减来缩短CoT,隐含地假设在整个推理过程中低不确定性是可取的。我们转而证明推理效率由不确定性的轨迹决定。具有主导向下熵趋势的CoT显著更短。受此洞见启发,我们提出了熵趋势奖励(ETR),一种轨迹感知的目标,鼓励渐进式不确定性降低同时允许有限的局部探索。我们将ETR集成到组相对策略优化(GRPO)中,并在多个推理模型和具有挑战性的基准上进行了评估。ETR一致地实现了更优的准确度-效率权衡,在四个基准上将DeepSeek-R1-Distill-7B的准确度提升9.9%的同时将CoT长度减少67%。代码可在https://github.com/Xuan1030/ETR获取。

关键词

引用

@article{arxiv.2604.05355,
  title  = {ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning},
  author = {Xuan Xiong and Huan Liu and Li Gu and Zhixiang Chi and Yue Qiu and Yuanhao Yu and Yang Wang},
  journal= {arXiv preprint arXiv:2604.05355},
  year   = {2026}
}

备注

ACL 2026 (Main)