中文

通过细粒度群策略优化实现长链式思维压缩

机器学习 2026-03-12 v2 人工智能

摘要

大型语言模型(LLM)常常生成不必要冗长的链式思维(Chain-of-Thought, CoT)推理,导致计算成本和延迟增加,而未获得相应的性能提升。本文提出细粒度群策略优化(Fine-grained Group policy Optimization, FGO),这是一种强化学习(RL)算法,通过细化群体响应并根据长度和熵分配合适的权重,从而实现有效的CoT压缩。同时,作为群体相对策略优化(Group Relative Policy Optimization, GRPO)的改进版本,FGO成功地解决了GRPO的两个主要局限性:数据利用效率低下和熵坍缩。我们在多个推理LLM和基准测试上评估了FGO,包括MATH500、AIME24、AMC23和Minerva。实验结果表明,FGO能够在不损害性能的前提下实现高效的CoT压缩,并解决了GRPO的关键局限性。代码:https://github.com/Mr-XcHan/FGO。

关键词

引用

@article{arxiv.2602.10048,
  title  = {Long Chain-of-Thought Compression via Fine-Grained Group Policy Optimization},
  author = {Xinchen Han and Hossam Afifi and Michel Marot and Xilu Wang and Lu Yin},
  journal= {arXiv preprint arXiv:2602.10048},
  year   = {2026}
}

备注

IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026