中文

自监督视频 Transformer

计算机视觉与模式识别 2022-03-22 v2

摘要

本文中,我们提出利用无标签视频数据对视频 transformer 进行自监督训练。对于给定的视频,我们创建具有不同空间尺寸和帧率的局部与全局时空视图。我们的自监督目标旨在匹配代表同一视频的这些不同视图的特征,以对动作中的时空变化保持不变性。据我们所知,所提方法是首个缓解自监督视频 Transformer(SVT)中对负样本或专用记忆库依赖的方法。此外,得益于 Transformer 模型的灵活性,SVT 支持在单一架构内通过动态调整位置编码实现慢-快视频处理,并支持沿时空维度进行长期关系建模。我们的方法在四个动作识别基准(Kinetics-400、UCF-101、HMDB-51 和 SSv2)上表现良好,并以小批量大小更快收敛。代码:https://git.io/J1juJ

关键词

引用

@article{arxiv.2112.01514,
  title  = {Self-supervised Video Transformer},
  author = {Kanchana Ranasinghe and Muzammal Naseer and Salman Khan and Fahad Shahbaz Khan and Michael Ryoo},
  journal= {arXiv preprint arXiv:2112.01514},
  year   = {2022}
}

备注

Accepted to CVPR '22