统一全景分割的训练与推理
计算机视觉与模式识别
2020-05-28 v2
摘要
我们提出一个端到端网络,以弥合全景分割训练与推理流程之间的差距,该任务旨在将图像划分为“背景 stuff”的语义区域和“物体 things”的实例。与近期工作不同,我们的网络利用了一个参数化却轻量的全景分割子模块,由端到端学习的稠密实例亲和度驱动,以捕捉任意两个像素属于同一实例的概率。该全景子模块产生了一种用于全景 logits 的新颖传播机制,并使网络能够为“stuff”和“thing”类输出连贯的全景分割图,无需任何后处理。得益于端到端训练,我们的完整系统在流行的街景数据集 Cityscapes 上创下新高,仅使用精细标注以 ResNet-50 骨干网络达到 61.4 PQ。在具挑战性的 COCO 数据集上,我们基于 ResNet-50 的网络也取得了 43.4 PQ 的 state-of-the-art 精度。此外,我们的网络可灵活地在有或无物体掩码提示下工作,在两种设定下均具竞争力,这对有计算预算的应用而言颇具意义。
引用
@article{arxiv.2001.04982,
title = {Unifying Training and Inference for Panoptic Segmentation},
author = {Qizhu Li and Xiaojuan Qi and Philip H. S. Torr},
journal= {arXiv preprint arXiv:2001.04982},
year = {2020}
}
备注
CVPR 2020