中文

基于目标对比奖励的机器人强化学习

机器人学 2025-05-16 v2 机器学习

摘要

强化学习 (RL) 有潜力使机器人通过自身在现实世界中的动作进行学习。遗憾的是,由于从稀疏奖励信号中学习时探索效率低下,RL 在机器人运行时间方面成本极高。设计稠密奖励函数费时费力,且需要领域专业知识。在我们的工作中,我们提出了 GCR(目标对比奖励),这是一种可以在被动视频演示上训练的稠密奖励函数学习方法。通过使用无动作的视频,我们的方法更易于扩展,因为我们可以使用任意视频。GCR 结合了两个损失函数:一个是对沿成功轨迹行进时奖励如何增加进行建模的隐式价值损失函数;另一个是区分成功与失败轨迹的目标对比损失函数。我们在 RoboMimic 和 MimicGen 任务的模拟操作环境中进行了实验,并使用 Franka 机械臂和 Spot 四足机器人在现实世界中进行了实验。我们发现 GCR 带来了更高的样本效率的 RL,使无模型 RL 能够解决的任务数量约为基线奖励学习方法的两倍。我们还展示了从人类和其他机器人执行任务的视频中实现的正向跨具身迁移。网站:https://gcr-robot.github.io/。

关键词

引用

@article{arxiv.2410.19989,
  title  = {On-Robot Reinforcement Learning with Goal-Contrastive Rewards},
  author = {Ondrej Biza and Thomas Weng and Lingfeng Sun and Karl Schmeckpeper and Tarik Kelestemur and Yecheng Jason Ma and Robert Platt and Jan-Willem van de Meent and Lawson L. S. Wong},
  journal= {arXiv preprint arXiv:2410.19989},
  year   = {2025}
}