R3M:一种用于机器人操作的通用视觉表征
机器人学
2022-11-21 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
我们研究在多样化人类视频数据上预训练的视觉表征如何赋能下游机器人操作任务的数据高效学习。具体而言,我们使用 Ego4D 人类视频数据集,结合时间对比学习、视频-语言对齐以及 L1 惩罚(以鼓励稀疏紧凑表征)来预训练视觉表征。所得表征 R3M 可用作下游策略学习的冻结感知模块。在 12 项模拟机器人操作任务组成的测试集中,我们发现 R3M 相较从头训练将任务成功率提升逾 20%,相较 CLIP 和 MoCo 等最优视觉表征提升逾 10%。此外,R3M 使 Franka Emika Panda 机械臂在真实杂乱公寓中仅给定 20 个演示即可学习一系列操作任务。代码与预训练模型见 https://tinyurl.com/robotr3m。
引用
@article{arxiv.2203.12601,
title = {R3M: A Universal Visual Representation for Robot Manipulation},
author = {Suraj Nair and Aravind Rajeswaran and Vikash Kumar and Chelsea Finn and Abhinav Gupta},
journal= {arXiv preprint arXiv:2203.12601},
year = {2022}
}
备注
Conference on Robot Learning (CoRL) 2022