以加背景之法去背景:面向背景鲁棒的自监督视频表征学习
计算机视觉与模式识别
2021-04-23 v4
摘要
自监督学习通过从数据自身获取监督,在提升深度神经网络的视频表征能力方面展现出巨大潜力。然而,当前部分方法倾向于从背景中作弊,即预测高度依赖于视频背景而非运动,使模型易受背景变化影响。为缓解模型对背景的依赖,我们提出通过添加背景来消除背景影响。具体而言,给定一段视频,我们随机选取一静态帧并将其叠加至其余每一帧,以构造一个干扰性视频样本。随后我们迫使模型将干扰视频与原视频的特征拉近,从而显式限制模型抵抗背景影响,更关注运动变化。我们将该方法称为\emph{背景擦除}(BE)。值得注意的是,本方法实现极为简洁,且可轻松添加至大多数 SOTA 方法中。具体而言,在严重偏置的数据集 UCF101 与 HMDB51 上,BE 结合 MoCo 分别带来 16.4% 与 19.1% 的提升,在偏置较轻的数据集 Diving48 上带来 14.5% 的提升。
引用
@article{arxiv.2009.05769,
title = {Removing the Background by Adding the Background: Towards Background Robust Self-supervised Video Representation Learning},
author = {Jinpeng Wang and Yuting Gao and Ke Li and Yiqi Lin and Andy J. Ma and Hao Cheng and Pai Peng and Feiyue Huang and Rongrong Ji and Xing Sun},
journal= {arXiv preprint arXiv:2009.05769},
year = {2021}
}
备注
CVPR2021 camera ready