中文

无奖励建模的大型视觉语言模型反馈下的策略学习

机器学习 2025-08-01 v1 机器人学

摘要

离线强化学习 (RL) 提供了一种使用预收集的次优数据集训练机器人智能体的强大框架,无需昂贵、耗时且可能危险的在线交互。这在安全关键的实际应用中尤为有用,其中在线数据收集昂贵且不可行。然而,现有的离线 RL 算法通常需要带有奖励标签的数据,这引入了一个额外的瓶颈:奖励函数的设计本身就昂贵、耗时,需要显著的领域专业知识。本文引入了 PLARE,一种新方法,利用大型视觉语言模型 (VLM) 提供智能体训练的指导信号。无需依赖手动设计的奖励函数,PLARE 查询 VLM 对基于语言任务描述的视觉轨迹段对进行偏好标签。随后,智能体使用监督对比偏好学习目标直接从这些偏好标签进行训练,无需学习显式奖励模型。通过在 MetaWorld 上进行大量实验,PLARE 在性能上与或超过现有基于 VLM 的奖励生成方法的 SOTA 水平持平。进一步,我们在物理机器人上演示了 PLARE 在实际操作任务中的有效性,进一步验证了其实际应用性。

关键词

引用

@article{arxiv.2507.23391,
  title  = {Policy Learning from Large Vision-Language Model Feedback without Reward Modeling},
  author = {Tung M. Luu and Donghoon Lee and Younghwan Lee and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2507.23391},
  year   = {2025}
}

备注

Accepted to IROS 2025