OGER:一种用于混合强化学习的稳健离线引导探索奖励
人工智能
2026-05-28 v2
摘要
近期在可验证奖励 (RLVR) 中的强化学习进展显著提升了大型语言模型 (LLM) 的推理能力,但模型常常难以探索超出初始策略分布的新颖轨迹。虽然提出了离线教师指导和熵驱动策略来解决此问题,但这些方法往往缺乏深入的集成,或受限于模型固有的能力。在本文中,我们提出 OGER(Offline-Guided Exploration Reward),一种新型框架,通过专门的奖励建模视角统一离线教师指导与在线强化学习。OGER 采用多教师协同训练,构建一个辅助探索奖励,利用离线轨迹和模型自身的熵来激励自主探索。广泛的实验在数学和通用推理基准上表明,OGER 在所有竞争基线上均表现出色,在数学推理方面实现显著提升,同时在面向域外任务的鲁棒性方面也表现出色。我们对训练动力学进行了全面分析,进行了详细的消融研究,以验证我们熵感知奖励调制的有效性。我们的代码已公开于 https://github.com/ecoli-hit/OGER.git。
引用
@article{arxiv.2604.18530,
title = {OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning},
author = {Xinyu Ma and Mingzhou Xu and Xuebo Liu and Chang Jin and Qiang Wang and Derek F. Wong and Min Zhang},
journal= {arXiv preprint arXiv:2604.18530},
year = {2026}
}