视频实例分割
计算机视觉与模式识别
2019-08-19 v4
摘要
本文提出一项新的计算机视觉任务,称为视频实例分割。该新任务的目标是对视频中的实例进行同步检测、分割与跟踪。换言之,这是图像实例分割问题首次被拓展至视频领域。为推动该新任务的研究,我们提出一个名为 YouTube-VIS 的大规模基准,其包含 2883 段高分辨率 YouTube 视频、一个 40 类标签集以及 131k 高质量实例掩码。此外,我们针对该任务提出一种称为 MaskTrack R-CNN 的新算法。我们的新方法在 Mask R-CNN 上引入一个新的跟踪分支,以同步联合执行检测、分割与跟踪任务。最后,我们在新数据集上评估所提方法及若干强基线。实验结果清晰展示了所提算法的优势,并为未来改进提供了见解。我们相信视频实例分割任务将激励社区沿视频理解的研究路线前进。
引用
@article{arxiv.1905.04804,
title = {Video Instance Segmentation},
author = {Linjie Yang and Yuchen Fan and Ning Xu},
journal= {arXiv preprint arXiv:1905.04804},
year = {2019}
}
备注
Accepted to ICCV 2019