中文

不所有思考都相等:通过多回合强化学习实现高效大语言模型推理

计算与语言 2025-05-27 v2 人工智能

摘要

压缩大型语言模型 (LLM) 中的长链式思考 (CoT) 是提高LLM推理效率的新兴策略。尽管该方法具有前景的好处,但现有研究在长CoT中对所有思考都等量压缩,阻碍了更简洁和有效的推理。为此,我们首先通过自动长CoT分块和蒙特卡洛滚动推演,检验不同思考在贡献推理方面的重要性和效率。基于这些见解,我们提出了一个在理论上受限的度量,用于联合衡量不同思考的有效性和效率。随后,我们提出了 Long⊗Short,一种高效推理框架,使两个LLM能够协作解决问题:一个长思考 LLM 用于更有效地生成重要思考,另一个短思考 LLM 用于高效地生成剩余思考。具体而言,我们首先合成少量冷启动数据,以微调LLM进行长思考和短思考推理风格。进一步地,我们提出一种以协同为导向的多回合强化学习,关注模型自演化和长思考与短思考 LLM 之间的协作。实验结果表明,我们的方法使 Qwen2.5-7B 和 Llama3.1-8B 能够在 MATH500、AIME24/25、AMC23 和 GPQA Diamond 基准测试中实现与 DeepSeek-R1-Distill-Qwen-7B 和 DeepSeek-R1-Distill-Llama-8B 相当的性能,同时将 token 长度缩短超过 80%。我们的数据和代码已公开:https://github.com/usail-hkust/LongShort。

关键词

引用

@article{arxiv.2505.11827,
  title  = {Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning},
  author = {Yansong Ning and Wei Li and Jun Fang and Naiqiang Tan and Hao Liu},
  journal= {arXiv preprint arXiv:2505.11827},
  year   = {2025}
}

备注

Under review