中文

解构熵-性能交换:解锁有效强化学习的缺失钥匙

计算与语言 2025-08-05 v1 人工智能

摘要

最近,基于可验证奖励的强化学习(RLVR)广泛用于增强大型语言模型(LLM)的推理能力。RLVR的一个核心挑战在于管理策略熵与性能之间的交换。尽管该交换具有重要意义,但对何时以及如何实现最有效交换的细粒度理解仍有限。为弥合这一差距,我们对RLVR在不同粒度水平上的熵-性能交换机制进行系统实证分析。具体而言,我们首先根据熵动力学将训练过程分为两个 distinct 阶段,即上升阶段和平台阶段,然后系统性地探讨该机制在阶段级、实例级和标记级不同粒度上的变化。我们的分析揭示,在上升阶段,负样本中的熵减少促进了有效推理模式的学习,从而驱动性能的快速提升。此外,在平台阶段,学习效率与高熵标记在低困惑度样本中以及序列末端位置的标记密切相关。针对这些发现,我们提出两种方法,通过动态调整基于困惑度和位置信息的奖励信号,以聚焦于表现出高学习潜力的标记进行RL更新,相较于基线方法在各种LLM上实现提升。

关键词

引用

@article{arxiv.2508.02260,
  title  = {Decomposing the Entropy-Performance Exchange: The Missing Keys to Unlocking Effective Reinforcement Learning},
  author = {Jia Deng and Jie Chen and Zhipeng Chen and Wayne Xin Zhao and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2508.02260},
  year   = {2025}
}

备注

7 pages, 20 figures