基于掩码视觉预训练的真实世界机器人学习
机器人学
2022-10-07 v1 计算机视觉与模式识别
机器学习
摘要
在这项工作中,我们探索了在来自多样化真实场景视频的图像上进行自监督视觉预训练,以用于真实世界机器人任务。与先前工作类似,我们的视觉表征通过掩码自编码器(MAE)进行预训练、冻结,然后传入可学习的控制模块。与先前工作不同,我们展示了预训练表征在一系列真实世界机器人任务和载体上均有效。我们发现我们的编码器一致地优于CLIP(高达75%)、有监督的ImageNet预训练(高达81%)以及从头训练(高达81%)。最后,我们在来自互联网和第一人称视频的450万张图像的大规模集合上训练了一个3.07亿参数的视觉Transformer,并清晰地展示了为机器人学习扩展视觉预训练的好处。
引用
@article{arxiv.2210.03109,
title = {Real-World Robot Learning with Masked Visual Pre-training},
author = {Ilija Radosavovic and Tete Xiao and Stephen James and Pieter Abbeel and Jitendra Malik and Trevor Darrell},
journal= {arXiv preprint arXiv:2210.03109},
year = {2022}
}
备注
CoRL 2022; Project page: https://tetexiao.com/projects/real-mvp