中文

MV2MAE:多视图视频掩码自编码器

计算机视觉与模式识别 2024-01-30 v1

摘要

来自多个视角捕获的视频有助于感知世界的3D结构,并受益于动作识别、跟踪等计算机视觉任务。在本文中,我们提出了一种从同步多视图视频中进行自监督学习的方法。我们采用跨视图重建任务将几何信息注入模型。我们的做法基于掩码自编码器 (MAE) 框架。除了相同的视图解码器外,我们引入了独立的跨视图解码器,该解码器利用跨注意力机制重建来自源视角视频的目标视角视频,以帮助对视角变化更稳健的表示。在视频中,静态区域可以轻易重建,这会阻碍学习有意义的表示。为此,我们引入了基于运动加权的重建损失,以改进时序建模。我们在NTU-60、NTU-120和ETRI数据集上报告了最新的结果,并在NUCLA、PKU-MMD-II和ROCOG-v2数据集上的迁移学习设置中也取得了优异成绩,表明了我们方法的稳健性。代码将予以公开。

关键词

引用

@article{arxiv.2401.15900,
  title  = {MV2MAE: Multi-View Video Masked Autoencoders},
  author = {Ketul Shah and Robert Crandall and Jie Xu and Peng Zhou and Marian George and Mayank Bansal and Rama Chellappa},
  journal= {arXiv preprint arXiv:2401.15900},
  year   = {2024}
}