中文

利用视频连续性进行自监督时空表征学习

计算机视觉与模式识别 2022-01-13 v3 机器学习

摘要

近期的自监督视频表征学习方法通过探索视频的本质属性(如速度、时间顺序等)取得了显著成功。本工作利用了一个本质却未被充分探索的视频属性——视频连续性,来获取自监督表征学习的监督信号。具体而言,我们构建了三个新颖的与连续性相关的代理任务,即连续性判断、不连续性定位与缺失片段逼近,它们联合监督一个共享主干网络进行视频表征学习。这种自监督方法被称为连续性感知网络(CPNet),它同时求解这三个任务,并鼓励主干网络学习局部与长程的运动及上下文表征。它在多个下游任务(如动作识别、视频检索与动作定位)上优于先前的方法。此外,视频连续性可与其他粗粒度视频属性互补用于表征学习,且将所提代理任务集成到先前方法中可带来显著的性能提升。

关键词

引用

@article{arxiv.2112.05883,
  title  = {Self-supervised Spatiotemporal Representation Learning by Exploiting Video Continuity},
  author = {Hanwen Liang and Niamul Quader and Zhixiang Chi and Lizhe Chen and Peng Dai and Juwei Lu and Yang Wang},
  journal= {arXiv preprint arXiv:2112.05883},
  year   = {2022}
}