视频全景分割
计算机视觉与模式识别
2020-06-23 v1
摘要
全景分割通过统一先前的语义分割与实例分割任务,已成为视觉识别任务的新标准。本文提出并探索该任务的一种新的视频扩展,称为视频全景分割。该任务要求生成一致的全景分割结果,以及视频帧间实例 id 的关联。为激励这一新任务的研究,我们提出了两类视频全景数据集。第一类是将合成 VIPER 数据集重新组织为视频全景格式,以利用其大规模像素标注。第二类是对 Cityscapes 验证集的时间扩展,通过提供新的视频全景标注(Cityscapes-VPS)。此外,我们提出了一种新颖的视频全景分割网络(VPSNet),它联合预测视频帧中的物体类别、边界框、掩码、实例 id 跟踪与语义分割。为提供适用于该任务的指标,我们提出了视频全景质量(VPQ)指标,并评估了我们的方法及若干其他基线。实验结果表明所提出的两个数据集的有效性。我们在 Cityscapes 的图像 PQ 以及 Cityscapes-VPS 和 VIPER 数据集的 VPQ 上均取得了 SOTA 结果。数据集与代码已公开可用。
引用
@article{arxiv.2006.11339,
title = {Video Panoptic Segmentation},
author = {Dahun Kim and Sanghyun Woo and Joon-Young Lee and In So Kweon},
journal= {arXiv preprint arXiv:2006.11339},
year = {2020}
}
备注
CVPR 2020 Oral. Code: see https://github.com/mcahny/vps