中文

通过值函数预训练从互联网视频中进行机器人离线强化学习

机器人学 2023-09-25 v1 计算机视觉与模式识别 机器学习

摘要

在互联网数据上的预训练已被证明是许多现代机器学习系统广泛泛化的关键要素。要在机器人强化学习(RL)中实现此类能力需要什么?离线 RL 方法从机器人经验数据集中学习,提供了一种将先验数据引入机器人学习流程的途径。然而,这些方法与视频数据(如 Ego4D)存在“类型不匹配”,后者是机器人领域可用的最大先验数据集,因为视频仅提供观测经验,缺乏 RL 方法所需的动作或奖励标注。在本文中,我们开发了一个在机器人离线 RL 中利用大规模人类视频数据集的系统,完全基于通过时序差分学习来学习值函数。我们表明,在视频数据集上的价值学习所学得的表征比其它从视频数据学习的方法更利于下游机器人离线 RL。我们的系统称为 V-PTR,结合了在视频数据上预训练的优势与在多样机器人数据上训练的机器人离线 RL 方法,从而产生了性能更优、动作鲁棒且泛化性广的操纵任务值函数与策略。在真实 WidowX 机器人上的若干操纵任务中,我们的框架生成的策略大幅优于先前方法。我们的视频和更多细节可在 https://dibyaghosh.com/vptr/ 找到。

关键词

引用

@article{arxiv.2309.13041,
  title  = {Robotic Offline RL from Internet Videos via Value-Function Pre-Training},
  author = {Chethan Bhateja and Derek Guo and Dibya Ghosh and Anikait Singh and Manan Tomar and Quan Vuong and Yevgen Chebotar and Sergey Levine and Aviral Kumar},
  journal= {arXiv preprint arXiv:2309.13041},
  year   = {2023}
}

备注

First three authors contributed equally