Rank2Reward:从被动视频中学习成型的奖励函数
机器人学
2024-04-24 v1
摘要
通过人在环的数据收集技术(如动觉教学或遥操作)利用演示来教授机器人新技能,给人类监督者带来了沉重的负担。与这种范式相反,提供正在执行任务的原始、无动作视觉数据通常要容易得多。此外,这些数据甚至可以从视频数据集或网络中挖掘。理想情况下,这些数据可以用于指导新环境中新任务的机器人学习,同时告知“做什么”和“怎么做”。编码“做什么”和“怎么做”的一种强大方法是推断一个用于强化学习的成型良好的奖励函数。挑战在于如何将视觉演示输入转化为成型良好且信息丰富的奖励函数。我们提出了一种名为 Rank2Reward 的技术,用于在无法访问任何低级状态和动作的情况下,从执行任务的视频中学习行为。我们通过利用视频学习一个奖励函数来实现这一点,该函数通过学习如何在演示中对视频帧进行时间排序,来衡量任务中的增量“进度”。通过推断出适当的排序,奖励函数能够通过指示何时正在取得任务进展来指导强化学习。该排序函数可以集成到对抗模仿学习方案中,从而产生一种无需利用已学习奖励函数即可学习行为的算法。我们在仿真和真实世界机械臂的多个桌面操作任务上,展示了 Rank2Reward 从原始视频中学习行为的有效性。我们还展示了如何轻松扩展 Rank2Reward 以适用于网络规模的视频数据集。
引用
@article{arxiv.2404.14735,
title = {Rank2Reward: Learning Shaped Reward Functions from Passive Video},
author = {Daniel Yang and Davin Tjia and Jacob Berg and Dima Damen and Pulkit Agrawal and Abhishek Gupta},
journal= {arXiv preprint arXiv:2404.14735},
year = {2024}
}
备注
ICRA 2024