FBOS-RL:反馈驱动的双目标协同强化学习
机器学习
2026-05-21 v1 人工智能
摘要
强化学习已成为对大规模模型推理能力进行对齐与解锁的基石。其核心训练循环的 GRPO 及其变体在 rollout 采样与策略更新之间交替进行。与监督学习不同,后者的每个梯度步骤都以显式的 ground-truth 目标为锚,因而该设置下更新模型参数的最优梯度方向事先并未知晓;高质量 rollout 在采样阶段因此充当了指导每个参数更新的“隐式教师”。然而,GRPO 采用简单的采样方案,对所有 rollout 都基于相同的原始提示进行条件化。当任务超出策略模型当前能力时,这种采样方案很少产生高质量的 rollout,导致策略模型在更新参数时缺乏有意义的梯度方向,从而引发训练停滞。为此,我们提出 FBOS-RL,即 Feedback-Driven Bi-Objective Synergistic reinforcement learning 框架。具体而言,我们让模型基于环境提供的反馈进行 Feedback-Guided Exploration Enhancement,并在此之上设计两个相互强化的训练目标:面向利用的策略对齐 (EPA) 和面向探索的能力培养 (ECC)。大量实验表明,EPA 与 ECC 可以相互强化,形成正向的飞轮效应,显著提高了强化学习的训练效率和最终性能上限。具体而言,在相同数量的 rollout 条件下,FBOS-RL 远快于 GRPO 和反馈基准方法,最终达到更高的性能上限,同时在整个训练过程中表现出更高的策略熵和更低的梯度范数。
引用
@article{arxiv.2605.20256,
title = {FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning},
author = {Xikai Zhang and Yongzhi Li and Likang Xiao and Yingze Zhang and Yanhua Cheng and Quan Chen and Peng Jiang and Wenjun Wu and Liu Liu},
journal= {arXiv preprint arXiv:2605.20256},
year = {2026}
}