中文

PolyphonicFormer:用于深度感知视频全景分割的统一查询学习

计算机视觉与模式识别 2022-12-29 v4

摘要

深度感知视频全景分割(DVPS)是一个新的具有挑战性的视觉问题,旨在同时预测视频中的全景分割与深度。先前工作通过扩展现有全景分割方法并增加额外的稠密深度预测与实例跟踪头来解决该任务。然而,深度与全景分割之间的关系未被充分探索——简单组合现有方法会导致冲突且需要谨慎的权重平衡。本文中,我们提出 PolyphonicFormer,一种视觉 transformer,在 DVPS 任务下统一这些子任务并得到更鲁棒的结果。我们的核心见解是,通过所提出的用目标查询预测实例级深度图的新范式,深度可与全景分割相调和,进而通过基于查询的学习探索两个任务间的关系。实验表明,我们的设计在深度估计与全景分割两方面均带来收益。由于每个物体查询还编码了实例级信息,自然地可通过表观学习直接进行跟踪。我们的方法在两个 DVPS 数据集(Semantic KITTI、Cityscapes)上取得最优结果,并在 ICCV-2021 BMTT Challenge 视频+深度赛道中排名第 1。代码见 https://github.com/HarborYuan/PolyphonicFormer 。

关键词

引用

@article{arxiv.2112.02582,
  title  = {PolyphonicFormer: Unified Query Learning for Depth-aware Video Panoptic Segmentation},
  author = {Haobo Yuan and Xiangtai Li and Yibo Yang and Guangliang Cheng and Jing Zhang and Yunhai Tong and Lefei Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2112.02582},
  year   = {2022}
}

备注

Accepted by ECCV 2022