中文

视频实例分割

计算机视觉与模式识别 2019-08-19 v4

摘要

本文提出一项新的计算机视觉任务,称为视频实例分割。该新任务的目标是对视频中的实例进行同步检测、分割与跟踪。换言之,这是图像实例分割问题首次被拓展至视频领域。为推动该新任务的研究,我们提出一个名为 YouTube-VIS 的大规模基准,其包含 2883 段高分辨率 YouTube 视频、一个 40 类标签集以及 131k 高质量实例掩码。此外,我们针对该任务提出一种称为 MaskTrack R-CNN 的新算法。我们的新方法在 Mask R-CNN 上引入一个新的跟踪分支,以同步联合执行检测、分割与跟踪任务。最后,我们在新数据集上评估所提方法及若干强基线。实验结果清晰展示了所提算法的优势,并为未来改进提供了见解。我们相信视频实例分割任务将激励社区沿视频理解的研究路线前进。

关键词

引用

@article{arxiv.1905.04804,
  title  = {Video Instance Segmentation},
  author = {Linjie Yang and Yuchen Fan and Ning Xu},
  journal= {arXiv preprint arXiv:1905.04804},
  year   = {2019}
}

备注

Accepted to ICCV 2019