中文

基于跨流原型对比的自监督视频表征学习

计算机视觉与模式识别 2021-10-22 v3

摘要

依赖于数据增强和对比损失函数的实例级对比学习技术在视觉表征学习领域取得了巨大成功。然而,它们并不适合利用视频丰富的动态结构,因为操作是在许多增强实例上进行的。本文提出“视频跨流原型对比”,一种从 RGB 和光流两种视图预测一致原型分配、在样本集上运行的新方法。具体而言,我们交替优化过程;在优化其中一个流时,所有视图都被映射到一个流原型向量集合。每个分配都由除与预测匹配的视图之外的所有视图来预测,从而将表征推向其分配的原型。结果,学到了蕴含运动信息且更高效的视频嵌入,而推理时无需显式计算光流。我们在最近邻视频检索和动作识别上取得了最先进的结果,使用 S3D 骨干在 UCF101 上比之前最佳高出 +3.2%(Top-1 准确率 90.5%),使用 R(2+1)D 骨干在 UCF101 上高出 +7.2%、在 HMDB51 上高出 +15.1%。

关键词

引用

@article{arxiv.2106.10137,
  title  = {Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting},
  author = {Martine Toering and Ioannis Gatopoulos and Maarten Stol and Vincent Tao Hu},
  journal= {arXiv preprint arXiv:2106.10137},
  year   = {2021}
}

备注

WACV2022