中文

避免过度思考与思考不足:面向 LLM 的课程感知预算调度

计算与语言 2026-04-23 v1

摘要

通过扩展推理来扩展测试时计算已成为提升大型语言模型(LLMs)能力的关键范式。然而,现有方法在固定或均匀采样的 token 预算下优化推理,忽略了问题难度与分配计算量之间的根本不匹配。这导致在简单问题上过度思考,在困难问题上思考不足,在各种推理场景中导致次优的 token 效率。在本文中,我们提出了预算自适应课程推理(BCAE),这是一个通过三个协同组件联合优化推理质量和 token 效率的统一框架:(1)预算条件统一策略,将 token 预算作为连续条件信号嵌入,消除了对解耦的思考与总结策略的需求;(2)课程感知预算调度器,根据实时学习进度自适应地将训练预算分布从简单问题向困难问题转移;(3)截断感知密集奖励机制,通过过程级验证在中间推理步骤提供细粒度的信用分配。我们进一步引入了预算条件优势估计(BCAE),一种新颖的方差缩减技术,将优势基线条件化于采样预算,产生更稳定的策略梯度。在数学推理基准(MATH、GSM8K、AIME 和 Minerva Math)上的实验表明,BACR 在所有 token 预算下均持续优于其他强基线,在紧张预算下准确率提升达 8.3%,同时与无约束推理相比平均 token 消耗减少 34%。

关键词

引用

@article{arxiv.2604.19780,
  title  = {Avoiding Overthinking and Underthinking: Curriculum-Aware Budget Scheduling for LLMs},
  author = {Amirul Rahman and Aisha Karim and Kenji Nakamura and Yi-Fan Ng},
  journal= {arXiv preprint arXiv:2604.19780},
  year   = {2026}
}