中文

REA-RL: 面向高效推理的反思感知在线强化学习

计算与语言 2026-03-02 v2 机器学习

摘要

大型推理模型 (LRMs) 在复杂任务中表现出色,但常面临过度思考的挑战,导致极高的推理成本。现有方法为 LRMs 合成较短的推理响应以供学习,但由于耗时的数据生成和过滤过程,不适用于在线场景。同时,在线强化学习主要采用长度奖励来鼓励较短的推理响应,但这往往会导致丧失反思能力并损害性能。为了解决这些问题,我们提出了 REA-RL,它引入了一个小型反思模型以在在线训练中实现高效扩展,同时提供并行采样和顺序修订。此外,设计了反思奖励以进一步防止 LRMs 偏好简短但缺乏反思的响应。实验表明,这两种方法在保持或提升性能的同时,显著提高了推理效率。两者的结合在性能和效率之间取得了良好的平衡,在不损害性能的情况下将推理成本降低了 36%。进一步分析表明,我们的方法通过在难题上保持反思频率,同时在简单问题上适当减少反思频率且不丧失反思能力,证明了其有效性。代码可在 https://github.com/hexuandeng/REA-RL 获取。

关键词

引用

@article{arxiv.2505.19862,
  title  = {REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning},
  author = {Hexuan Deng and Wenxiang Jiao and Xuebo Liu and Jun Rao and Min Zhang},
  journal= {arXiv preprint arXiv:2505.19862},
  year   = {2026}
}

备注

Accepted by ICLR 2026