中文

用于视频表示学习的可控增强方法

计算机视觉与模式识别 2022-04-04 v2

摘要

本文关注自监督视频表示学习。大多数现有方法遵循对比学习流程,通过采样不同片段来构造正样本对与负样本对。然而,这种形式往往偏向于静态背景,且难以建立全局时间结构。其主要原因在于正样本对(即同一视频中采样的不同片段)具有有限的时间感受野,通常共享相似背景而仅在运动上有所差异。为解决这些问题,我们提出一种框架,联合利用局部片段与全局视频,从精细的区域级对应以及总体长期时间关系中学习。基于一组可控增强,我们通过软时空区域对比实现精确的外观与运动模式对齐。我们的形式能够通过互信息最小化避免低层冗余捷径,从而提升泛化能力。我们还引入局部-全局时间顺序依赖,进一步弥合片段级与视频级表示之间的差距,以实现鲁棒的时间建模。大量实验表明,我们的框架在动作识别与视频检索的三个视频基准上表现更优,捕捉到更准确的时间动态。

关键词

引用

@article{arxiv.2203.16632,
  title  = {Controllable Augmentations for Video Representation Learning},
  author = {Rui Qian and Weiyao Lin and John See and Dian Li},
  journal= {arXiv preprint arXiv:2203.16632},
  year   = {2022}
}