中文

MaskViT:用于视频预测的掩码视觉预训练

计算机视觉与模式识别 2022-08-09 v2 机器学习 机器人学

摘要

基于过去观测和动作指令预测未来视觉观测的能力,可使具身智能体能够在复杂环境中规划解决各种任务。本工作表明,我们可以通过掩码视觉建模预训练 Transformer 来创建优秀的视频预测模型。我们的方法名为 MaskViT,基于两个简单的设计决策。首先,为了内存和训练效率,我们使用两种类型的窗口注意力:空间的和时空的。其次,在训练期间,我们掩码可变比例的 token,而非固定掩码率。在推理时,MaskViT 通过迭代细化生成所有 token,其中我们依据掩码调度函数逐步降低掩码率。在多个数据集上,我们证明 MaskViT 在视频预测上优于先前工作,参数高效,并能生成高分辨率视频(256x256)。此外,我们通过在真实机器人上使用 MaskViT 进行规划,展示了由于迭代解码带来的推理加速(高达 512x)优势。我们的工作表明,我们可以通过利用掩码视觉建模的通用框架并以最小领域知识赋予具身智能体强大的预测模型。

关键词

引用

@article{arxiv.2206.11894,
  title  = {MaskViT: Masked Visual Pre-Training for Video Prediction},
  author = {Agrim Gupta and Stephen Tian and Yunzhi Zhang and Jiajun Wu and Roberto Martín-Martín and Li Fei-Fei},
  journal= {arXiv preprint arXiv:2206.11894},
  year   = {2022}
}

备注

Project page: https://maskedvit.github.io/