面向运动控制的掩码视觉预训练
计算机视觉与模式识别
2022-03-14 v1 机器学习
机器人学
摘要
本文表明,基于真实世界图像的自监督视觉预训练对于从像素学习运动控制任务是有效的。我们首先通过自然图像的掩码建模来训练视觉表征。随后冻结视觉编码器,并在其上通过强化学习训练神经网络控制器。我们不对编码器进行任何任务特定的微调;相同的视觉表征被用于所有运动控制任务。据我们所知,这是首个利用大规模真实世界图像进行运动控制的自监督模型。为加速从像素学习的研究进展,我们贡献了一套由手工设计、在运动、场景和机器人方面各异的基准任务套件。在不依赖标签、状态估计或专家演示的情况下,我们始终以高达 80% 的绝对成功率优于监督编码器,有时甚至匹配预言机状态性能。我们还发现,野外图像(例如来自 YouTube 或自我中心视频)比 ImageNet 图像能为各类操控任务带来更好的视觉表征。
引用
@article{arxiv.2203.06173,
title = {Masked Visual Pre-training for Motor Control},
author = {Tete Xiao and Ilija Radosavovic and Trevor Darrell and Jitendra Malik},
journal= {arXiv preprint arXiv:2203.06173},
year = {2022}
}
备注
Code and videos at: https://tetexiao.com/projects/mvp