中文

ExpThink:用于自适应思维链压缩的经验引导强化学习

机器学习 2026-05-19 v2 计算与语言

摘要

大型推理模型通过扩展的思维链推理实现了强大的性能,但遭受了过多的令牌消耗和高推理延迟。现有的用于思维链压缩的强化学习方法依赖于统一的、静态的长度惩罚,忽略了模型能力动态和问题级别的难度变化。我们提出了ExpThink,一个通过两种互补机制解决这两个维度的强化学习框架。首先,经验引导的奖励塑造追踪每个问题迄今为止找到的最短正确解,并应用三级奖励:对简洁正确回答给予满分,对冗长正确回答给予折扣分,对错误回答给予零分。阈值随着模型改进自动收紧,形成一个无需手动调度的自我演化课程。其次,难度自适应优势用正确计数归一化取代了标准差归一化,产生单调的难度缩放梯度,该梯度放大困难问题上的学习以保持准确性,同时抑制简单问题上的梯度以鼓励简洁性。这些机制共同强制执行一个准确性优先、压缩次之的训练目标。在多个数学推理基准上的实验表明,ExpThink在将平均响应长度减少高达77%的同时提高了准确性,实现了比原始基线高达3倍的准确率-效率比,并在两个指标上均优于现有的基于强化学习的压缩方法。

关键词

引用

@article{arxiv.2605.07501,
  title  = {ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression},
  author = {Tingcheng Bian and Yuzhe Zhang and Jing Jin and Jinchang Luo and MingQuan Cheng and Haiwei Wang and Wenyuan Jiang and Miaohui Wang},
  journal= {arXiv preprint arXiv:2605.07501},
  year   = {2026}
}

备注

39 pages, 18 figures. Code and model checkpoints will be released upon publication