中文

通过多级特征优化增强自监督视频表征学习

计算机视觉与模式识别 2021-08-18 v2

摘要

自监督视频表征学习的关键在于从无标签视频中构建通用特征。然而,近期多数工作主要关注高层语义,忽视了对通用视频理解至关重要的低层表示及其时间关系。为应对这些挑战,本文提出一种多级特征优化框架,以提升所学视频表示的泛化与时间建模能力。具体地,利用从朴素与原型对比学习获得的高层特征构建分布图,引导低层与中层特征学习过程。我们还从多级特征设计了一个简单的时间建模模块以增强运动模式学习。实验表明,带图约束与时间建模的多级特征优化能大幅提升视频理解中的表征能力。代码见 https://github.com/shvdiwnkozbw/Video-Representation-via-Multi-level-Optimization。

关键词

引用

@article{arxiv.2108.02183,
  title  = {Enhancing Self-supervised Video Representation Learning via Multi-level Feature Optimization},
  author = {Rui Qian and Yuxi Li and Huabin Liu and John See and Shuangrui Ding and Xian Liu and Dian Li and Weiyao Lin},
  journal= {arXiv preprint arXiv:2108.02183},
  year   = {2021}
}

备注

ICCV 2021