中文

无需视频标注学习跟踪实例

计算机视觉与模式识别 2021-04-02 v1

摘要

多实例分割掩码跟踪已被深入研究,但仍面临两个基本挑战:1) 对大规模逐帧标注的需求,以及 2) 两阶段方法的复杂性。为解决这些挑战,我们引入一种新颖的半监督框架,仅利用带标注图像数据集与无标注视频序列来学习实例跟踪网络。借助实例对比目标,我们学习一个嵌入以区分每个实例与其他实例。我们表明即使仅在图像上训练,所学特征表示对实例外观变化也具有鲁棒性,从而能够跨帧稳定跟踪对象。我们进一步通过自监督方式从无标注视频中学习对应关系的手段增强该嵌入的跟踪能力。此外,我们将该模块集成到单阶段实例分割与姿态估计框架中,与两阶段网络相比显著降低了跟踪的计算复杂度。我们在 YouTube-VIS 和 PoseTrack 数据集上开展实验。在无需任何视频标注工作的情况下,我们提出的方法能取得与大多数全监督方法相当甚至更优的性能。

关键词

引用

@article{arxiv.2104.00287,
  title  = {Learning to Track Instances without Video Annotations},
  author = {Yang Fu and Sifei Liu and Umar Iqbal and Shalini De Mello and Humphrey Shi and Jan Kautz},
  journal= {arXiv preprint arXiv:2104.00287},
  year   = {2021}
}

备注

CVPR 2021