中文

超越欧几里得裁剪:通过黎曼等距策略优化克服LLM强化学习中的探索崩溃

机器学习 2026-07-11 v1 人工智能

摘要

强化学习(RL)已成为增强LLM推理能力的主导范式。然而,采用PPO-Clip的RL算法固有地受到探索崩溃的限制。后续工作主要仍是启发式的,未能识别PPO-Clip失败的根本原因。本研究揭示了PPO-Clip的根本缺陷:它隐式地使用欧几里得度量来衡量策略差异,这在理论上与策略黎曼流形上的内在几何不一致。这种几何不匹配导致在低概率区域更新过于保守,而在高概率区域更新过于激进,最终导致探索崩溃。为纠正这一几何缺陷,我们提出了黎曼等距策略优化(RIPO),它保证了黎曼流形上的等距策略更新,有效平衡了探索与利用。我们进一步证明RIPO实现了有利的偏差-方差权衡,从而稳定了优化过程。大量实验表明,RIPO在七个竞赛级基准上显著超越了现有的LLM RL算法(在AIME24上比GRPO提升高达60%)。

关键词

引用

@article{arxiv.2607.10169,
  title  = {Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization},
  author = {Zhicheng Cai and Xinyuan Guo and Hanlin Wu and Mingxuan Wang and Wei-Ying Ma and Ya-Qin Zhang and Hao Zhou},
  journal= {arXiv preprint arXiv:2607.10169},
  year   = {2026}
}

备注

ICML 2026