中文

通过视频中图像块跟踪的无监督视觉表征学习

计算机视觉与模式识别 2021-05-07 v1

摘要

受人类眼睛在幼年和童年中期持续发育跟踪能力这一事实的启发,我们提出将跟踪作为计算机视觉系统学习视觉表征的代理任务。模仿儿童玩耍的 Catch 游戏,我们设计了一个 Catch-the-Patch(CtP)游戏,供 3D-CNN 模型学习有助于视频相关任务的视觉表征。在所提出的预训练框架中,我们从给定视频中裁剪出一个图像块,并使其按预设轨迹缩放和移动。该代理任务是在仅给定第一帧中目标边界框的情况下,估计图像块在一系列视频帧中的位置和大小。我们发现同时使用多个图像块能带来明显收益。我们进一步通过随机使图像块不可见来增加游戏难度。在主流基准上的大量实验证明了 CtP 相对于其他视频预训练方法的优越性能。此外,CtP 预训练的特征比由有监督动作识别任务训练的特征对域间隙更不敏感。当二者均在 Kinetics-400 上训练时,我们惊喜地发现 CtP 预训练的表征在 Something-Something 数据集上取得了比其全监督对应物高得多的动作分类准确率。代码已在线提供:github.com/microsoft/CtP。

关键词

引用

@article{arxiv.2105.02545,
  title  = {Unsupervised Visual Representation Learning by Tracking Patches in Video},
  author = {Guangting Wang and Yizhou Zhou and Chong Luo and Wenxuan Xie and Wenjun Zeng and Zhiwei Xiong},
  journal= {arXiv preprint arXiv:2105.02545},
  year   = {2021}
}

备注

To appear in CVPR'21. Code available at github.com/microsoft/CtP