中文

时空裁剪与注意力:改进跨模态视频表征学习

计算机视觉与模式识别 2021-10-28 v2

摘要

自监督学习所得图像表征的质量强烈依赖于学习公式中使用的增强数据类型。近期论文将这些方法从静态图像移植到视频,并发现利用音频与视频信号二者可带来显著增益;然而,它们未发现如裁剪之类的空间增强——对静态图像非常重要——对视频同样有效。本文以两种独特于视频时空特性的方式改进这些公式。首先,对于空间,我们表明空间增强如裁剪确实对视频也有效,但先前的实现由于高处理与内存开销,无法在足以使其生效的规模上执行。为解决此问题,我们首先引入特征裁剪(Feature Crop),一种在特征空间中更直接高效模拟此类增强的方法。其次,我们表明不同于朴素平均池化,基于 transformer 的注意力的使用显著提升了性能,且非常适于处理特征裁剪。将我们的两项发现结合为新方法时空裁剪与注意力(STiCA),我们在多个视频表征学习基准上取得了最先进性能。特别地,在 Kinetics-400 上预训练时,我们在 HMDB-51 上取得了 67.0% 的新最先进准确率,在 UCF-101 上取得了 93.1% 的新最先进准确率。

关键词

引用

@article{arxiv.2103.10211,
  title  = {Space-Time Crop & Attend: Improving Cross-modal Video Representation Learning},
  author = {Mandela Patrick and Yuki M. Asano and Bernie Huang and Ishan Misra and Florian Metze and Joao Henriques and Andrea Vedaldi},
  journal= {arXiv preprint arXiv:2103.10211},
  year   = {2021}
}

备注

Accepted to ICCV 2021. Code at https://github.com/facebookresearch/GDT