面向视觉机器人操作的多视图掩码世界模型
机器人学
2023-06-01 v2 计算机视觉与模式识别
机器学习
摘要
视觉机器人操作的研究和应用通常使用多个摄像头或视图来更好地感知世界。我们还能如何利用多视图数据的丰富性?在本文中,我们研究了如何利用多视图数据学习良好的表征,并将其用于视觉机器人操作。具体来说,我们训练了一个多视图掩码自编码器,该编码器重建随机掩码视点的像素,然后学习一个基于该自编码器表征进行操作的世界模型。我们在一系列场景中展示了我们方法的有效性,包括多视图控制以及使用辅助摄像头进行表征学习的单视图控制。我们还表明,使用多个随机化视点训练的多视图掩码自编码器,能够训练出具有强视点随机化能力的策略,并将该策略迁移到解决真实机器人任务中,无需相机标定和适配过程。视频演示可在以下网址获取:https://sites.google.com/view/mv-mwm。
引用
@article{arxiv.2302.02408,
title = {Multi-View Masked World Models for Visual Robotic Manipulation},
author = {Younggyo Seo and Junsu Kim and Stephen James and Kimin Lee and Jinwoo Shin and Pieter Abbeel},
journal= {arXiv preprint arXiv:2302.02408},
year = {2023}
}
备注
Accepted to ICML 2023. First two authors contributed equally. Project webpage: https://sites.google.com/view/mv-mwm