中文

基于运动对比感知的自监督视频表示学习

计算机视觉与模式识别 2022-04-12 v1 人工智能

摘要

仅视觉的自监督学习在视频表示学习中已取得显著进展。现有相关方法通过对比学习或设计特定代理任务鼓励模型学习视频表示。然而,部分模型易聚焦于背景,而背景对学习视频表示并不重要。为缓解该问题,我们提出一种称为长程残差帧的新视角以获取更多运动特异性信息。基于此,我们提出运动对比感知网络(MCPNet),其由运动信息感知(MIP)与对比实例感知(CIP)两个分支组成,通过关注视频中变化区域来学习通用视频表示。具体而言,MIP分支旨在学习细粒度运动特征,CIP分支执行对比学习以学习各实例的整体语义信息。在两个基准数据集UCF-101与HMDB-51上的实验表明,我们的方法优于当前最先进的仅视觉自监督方法。

关键词

引用

@article{arxiv.2204.04607,
  title  = {Self-Supervised Video Representation Learning with Motion-Contrastive Perception},
  author = {Jinyu Liu and Ying Cheng and Yuejie Zhang and Rui-Wei Zhao and Rui Feng},
  journal= {arXiv preprint arXiv:2204.04607},
  year   = {2022}
}

备注

Accepted by ICME 2022