中文

孪生掩码自编码器

计算机视觉与模式识别 2023-05-24 v1 机器学习

摘要

建立图像或场景之间的对应关系是计算机视觉中的一项重大挑战,尤其是在存在遮挡、视角变化以及物体外观变化的情况下。在本文中,我们提出孪生掩码自编码器(SiamMAE),它是掩码自编码器(MAE)的一个简单扩展,用于从视频中学习视觉对应关系。SiamMAE 对随机采样的视频帧对进行操作,并对它们进行非对称掩码。这些帧由编码器网络独立处理,而由一系列交叉注意力层组成的解码器负责预测未来帧中缺失的图像块。通过在未来帧中掩码掉绝大部分(95%95\%)图像块而保持过去帧不变,SiamMAE 促使网络聚焦于物体运动并学习以物体为中心的表示。尽管概念简单,通过 SiamMAE 学习到的特征在视频物体分割、姿态关键点传播和语义部件传播任务上优于最先进的自监督方法。SiamMAE 在不依赖数据增强、基于手工跟踪的代理任务或其他防止表示坍缩的技术的情况下取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2305.14344,
  title  = {Siamese Masked Autoencoders},
  author = {Agrim Gupta and Jiajun Wu and Jia Deng and Li Fei-Fei},
  journal= {arXiv preprint arXiv:2305.14344},
  year   = {2023}
}

备注

Project page https://siam-mae-video.github.io/