中文

用于自监督视频表征学习的层次化解耦时空对比方法

计算机视觉与模式识别 2021-09-02 v2 人工智能 机器学习

摘要

我们提出一种新颖的自监督视频表征学习技术,通过以下方式实现:(a) 将学习目标解耦为分别强调空间与时间特征的两个对比子任务;(b) 层次化执行以鼓励多尺度理解。受其在监督学习中有效性的启发,我们首次将时空特征学习解耦与层次化学习引入无监督视频学习语境。我们通过实验表明,增强可作为正则化手段引导网络在对比学习中学习所需语义,并提出一种让模型在多尺度上分别捕捉空间与时间特征的方法。我们还引入一种方法,通过将不变性建模为损失权重以重加权目标,克服不同层次实例不变性水平发散的问题。在 UCF101 与 HMDB51 下游动作识别基准上的实验表明,我们提出的层次化解耦时空对比(HDC)相较将时空特征作为整体直接学习有显著提升,并与其他最先进无监督方法相比具有竞争力。代码将公开。

关键词

引用

@article{arxiv.2011.11261,
  title  = {Hierarchically Decoupled Spatial-Temporal Contrast for Self-supervised Video Representation Learning},
  author = {Zehua Zhang and David Crandall},
  journal= {arXiv preprint arXiv:2011.11261},
  year   = {2021}
}