用于时空表征的对偶对比学习
计算机视觉与模式识别
2022-07-13 v1
摘要
对比学习在自监督时空表征学习中已展现出良好潜力。多数工作朴素地采样不同片段来构造正、负对。然而,我们观察到此种设定使模型偏向背景场景偏差。其潜在原因有二:首先,场景差异通常比运动差异更显著且更易区分;其次,同一视频采得的片段常具相似背景但运动不同。简单将其视为正对会把模型拉向静态背景而非运动模式。为应对此挑战,本文提出一种新颖的对偶对比公式。具体而言,我们将输入RGB视频序列解耦为静态场景与动态运动两种互补模态。随后,原始RGB特征分别被拉近静态特征与对齐的动态特征。如此,静态场景与动态运动被同时编码进紧凑的RGB表征中。我们进一步通过激活图进行特征空间解耦以提取静态与动态相关特征。我们将该方法称为用于时空表征的\textbf{D}ual \textbf{C}ontrastive \textbf{L}earning (DCLR)。大量实验表明,DCLR学到了有效的时空表征,并在UCF-101、HMDB-51和Diving-48数据集上取得最先进或可比性能。
引用
@article{arxiv.2207.05340,
title = {Dual Contrastive Learning for Spatio-temporal Representation},
author = {Shuangrui Ding and Rui Qian and Hongkai Xiong},
journal= {arXiv preprint arXiv:2207.05340},
year = {2022}
}
备注
ACM MM 2022 camera ready