中文

ViP-DeepLab:利用深度感知视频全景分割学习视觉感知

计算机视觉与模式识别 2020-12-11 v1

摘要

本文提出 ViP-DeepLab,一个试图解决视觉中长期存在且具挑战性的逆投影问题的统一模型,我们将其建模为从透视图像序列恢复点云,同时为每一点提供实例级语义解释。解决该问题需要视觉模型预测每个 3D 点的空间位置、语义类别和时间一致的实例标签。ViP-DeepLab 通过联合执行单目深度估计与视频全景分割来处理它。我们将此联合任务命名为深度感知视频全景分割(Depth-aware Video Panoptic Segmentation),并提出一种新的评估指标及两个衍生数据集,将向公众开放。在各子任务上,ViP-DeepLab 也取得 SOTA 结果,在 Cityscapes-VPS 上以 5.1% VPQ 优于先前方法,在 KITTI 单目深度估计基准上排名第 1,在 KITTI MOTS 行人上排名第 1。数据集与评估代码已公开。

关键词

引用

@article{arxiv.2012.05258,
  title  = {ViP-DeepLab: Learning Visual Perception with Depth-aware Video Panoptic Segmentation},
  author = {Siyuan Qiao and Yukun Zhu and Hartwig Adam and Alan Yuille and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2012.05258},
  year   = {2020}
}

备注

Video: https://youtu.be/XR4HFiwwao0 GitHub: https://github.com/joe-siyuan-qiao/ViP-DeepLab