中文

VARP:基于智能体正则化偏好与视觉语言模型反馈的强化学习

人工智能 2025-03-19 v1 人机交互 机器学习 机器人学

摘要

在连续控制机器人任务中设计奖励函数常会导致细微的误差或奖励入侵,尤其在复杂任务中更为突出。基于偏好的强化学习通过比较反馈来学习奖励,一定程度上缓解了这些问题,但规模化的人类标注仍面临挑战。最近的研究利用视觉语言模型(Vision-Language Models, VLM)自动化偏好标注,但单一的最终状态图像通常无法捕捉智能体完整的运动轨迹。本文提出了双重解决方案,既改善反馈准确性,又更好地将奖励学习与智能体策略对齐。首先,我们在最终观察图像上叠加轨迹草图,以揭示所采取的路径,使视觉语言模型能够提供更可靠的偏好反馈——在 metaworld 任务中将偏好准确性提升约 15-20%。其次,我们通过纳入智能体性能来对奖励学习进行正则化处理,确保奖励模型是基于当前策略生成的数据进行优化;这一改进在 locomotion 任务中将 episode 返回提升 20-30%。emetra studies on metaworld 表明,我们的方法在例如 70-80% 的成功率上实现了目标,而常规方法则低于 50%。这些结果凸显了将更丰富的视觉表征与智能体感知奖励正则化相结合的有效性。

关键词

引用

@article{arxiv.2503.13817,
  title  = {VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences},
  author = {Anukriti Singh and Amisha Bhaskar and Peihong Yu and Souradip Chakraborty and Ruthwik Dasyam and Amrit Bedi and Pratap Tokekar},
  journal= {arXiv preprint arXiv:2503.13817},
  year   = {2025}
}

备注

8 pages