中文

基于前景-背景融合的运动感知对比视频表征学习

计算机视觉与模式识别 2022-03-15 v3

摘要

鉴于对比学习在图像领域的成功,当前自监督视频表征学习方法通常采用对比损失来促进视频表征学习。然而,当朴素地将同一视频的两个增强视图拉近时,模型往往将常见的静态背景作为捷径来学习,却未能捕捉运动信息,这一现象被称为背景偏差。这种偏差导致模型泛化能力弱,在动作识别等下游任务上性能较差。为缓解该偏差,我们提出前景-背景融合(FAME),有意地将所选视频的运动前景区域合成到其他视频的静态背景上。具体而言,在无需任何现成检测器的情况下,我们通过帧差与颜色统计从背景区域中提取运动前景,并在视频间打乱背景区域。通过利用原始片段与融合片段之间的语义一致性,模型更关注运动模式,并从背景捷径中去除偏差。大量实验表明,FAME能有效抵抗背景欺骗,从而在 UCF101、HMDB51 和 Diving48 数据集的下游任务上取得最先进的性能。代码与配置已发布于 https://github.com/Mark12Ding/FAME。

关键词

引用

@article{arxiv.2109.15130,
  title  = {Motion-aware Contrastive Video Representation Learning via Foreground-background Merging},
  author = {Shuangrui Ding and Maomao Li and Tianyu Yang and Rui Qian and Haohang Xu and Qingyi Chen and Jue Wang and Hongkai Xiong},
  journal= {arXiv preprint arXiv:2109.15130},
  year   = {2022}
}

备注

CVPR2022 camera ready