中文

通过解耦场景与运动增强无监督视频表示学习

计算机视觉与模式识别 2020-12-17 v3

摘要

我们期望视频表示学习(尤其是与图像表示学习相比)捕捉的一个重要因素是物体运动。然而,我们发现当前主流视频数据集中,某些动作类别与动作发生的场景高度相关,使得模型倾向于退化为仅编码场景信息的解决方案。例如,训练好的模型可能仅因看到球场就预测视频为踢足球,而忽略了主体是在球场上作为拉拉队员跳舞。这违背了我们对视频表示学习的初衷,并可能在不同数据集上带来不可忽视的场景偏差。为解决这个问题,我们提出通过两个简单操作解耦场景与运动(DSM),使模型对运动信息的关注得以更好体现。具体而言,我们为每个视频构造一个正片段和一个负片段。与原始视频相比,正/负片段通过空间局部扰动和时间局部扰动实现运动未破坏/破坏但场景破坏/未破坏。我们的目标是在潜空间将正片段拉近同时将负片段推远于原始片段。以此方式,场景的影响被削弱,而网络的时间敏感性进一步增强。我们在两项任务上使用多种主干网络和不同预训练数据集进行实验,发现我们的方法在使用相同主干时于UCF101和HMDB51数据集的动作识别任务上分别超越SOTA方法,取得显著的8.1%和8.8%提升。

关键词

引用

@article{arxiv.2009.05757,
  title  = {Enhancing Unsupervised Video Representation Learning by Decoupling the Scene and the Motion},
  author = {Jinpeng Wang and Yuting Gao and Ke Li and Jianguo Hu and Xinyang Jiang and Xiaowei Guo and Rongrong Ji and Xing Sun},
  journal= {arXiv preprint arXiv:2009.05757},
  year   = {2020}
}

备注

AAAI2021 camera-ready