中文

ThinkPrune:通过强化学习修剪 LLM 的长链思考

计算与语言 2025-04-03 v1

摘要

我们提出了 ThinkPrune,这是一种简单而有效的方法,用于修剪长链思考 LLM 的思考长度,这种现象被发现会导致不必要的冗余思考过程。现有的初步探索主要集中在强制提前退出思考过程,而非让 LLM 优化和巩固思考过程,因此迄今为止观察到的长度-性能权衡并不优化。为填补这一空白,ThinkPrune 提出了一种简单方法,通过强化学习 (RL) 持续训练长思考 LLM,并添加令牌限制,超过该限制的任何未完成的思考和答案将被丢弃,导致零奖励。为进一步保留模型性能,我们引入了迭代长度修剪方法,即通过多个 RL 轮次进行训练,每一轮的令牌限制越来越严格。我们观察到,ThinkPrune 在 AIME24 数据集上实现了惊人的性能-长度权衡——DeepSeek-R1-Distill-Qwen-1.5B 的推理长度可缩减一半,仅降低 2% 的性能。我们还观察到,修剪后,LLM 可以在保持核心推理过程完整的同时跳过不必要的步骤。代码已公开于 https://github.com/UCSB-NLP-Chang/ThinkPrune。

关键词

引用

@article{arxiv.2504.01296,
  title  = {ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning},
  author = {Bairu Hou and Yang Zhang and Jiabao Ji and Yujian Liu and Kaizhi Qian and Jacob Andreas and Shiyu Chang},
  journal= {arXiv preprint arXiv:2504.01296},
  year   = {2025}
}

备注

15 pages, 7 figures