中文

离线RLAIF:通过SFO实现VLM反馈的强化学习

机器学习 2025-09-16 v6 人工智能

摘要

虽然大规模图像和文本数据已使视觉语言模型 (VLM) 在通用化方面取得显著进展,但缺乏大规模控制数据仍阻碍了标准强化学习 (RL) 智能体获得类似的通用化能力。尽管VLM在缺乏动作条件训练数据的情况下在解决控制任务方面受限,但其图像理解能力使其能够通过识别成功结果来为RL任务提供有价值的反馈。强化学习从AI反馈 (RLAIF) 的关键挑战在于如何将VLM派生信号最佳集成到学习过程中。我们在离线RL情境下探索此问题,提出称为子轨迹过滤优化 (SFO) 的方法。我们识别出三个关键见解:首先,轨迹长度在离线RL中发挥关键作用,因为完整轨迹的偏好学习加剧了拼接问题, necessitating 使用子轨迹。其次,即使在马尔可夫环境中,也需要来自图像序列的非马尔可夫奖励信号来评估轨迹改进,因为VLM不解释控制动作,必须依赖随时间变化的视觉线索。第三,一种简单而有效的方法——过滤加权的行为克隆—— consistently 优于更复杂的RLHF方法。我们提出子轨迹过滤行为克隆 (SFBC) 方法,该方法利用VLM对子轨迹的反馈,并纳入一种回溯过滤机制,以移除失败前的子轨迹,从而提高鲁棒性并防止震荡。请享受我们的机场段子。

关键词

引用

@article{arxiv.2503.01062,
  title  = {Offline RLAIF: Piloting VLM Feedback for RL via SFO},
  author = {Jacob Beck},
  journal= {arXiv preprint arXiv:2503.01062},
  year   = {2025}
}

备注

Code is provided at https://github.com/jacooba/OfflineRLAIF