中文

全景分割

计算机视觉与模式识别 2024-07-15 v2

摘要

全景图像捕获360{\deg}视场(FOV),涵盖全向空间信息,对场景理解至关重要。然而获取足够训练密集标注的全景图像成本高昂,且在近期词汇设置下训练模型时受限明显。为解决此问题,本文定义了新任务——开放式全景分割(OPS),即在源域中使用视场受限的针孔图像进行训练,同时在开放词汇环境下训练;而在目标域中使用视场开放的全景图像进行评估,使模型具备零样本全景语义分割能力。此外,我们提出一种名为OOOPS的模型,配备可变形适配器网络(DAN),显著提高零样本全景语义分割性能。为进一步增强从针孔源域中捕捉畸变感知建模能力,我们提出一种新型数据增强方法,称为随机等距投影(RERP),专为解决对象畸变而设计。超过其他领先的开放式语义分割方法,在三个全景数据集WildPASS、Stanford2D3D和Matterport3D上实现显著性能提升,尤其在户外WildPASS上提升2.2%,在室内Stanford2D3D上mIoU提升2.4%。源代码已公开发布。

关键词

引用

@article{arxiv.2407.02685,
  title  = {Open Panoramic Segmentation},
  author = {Junwei Zheng and Ruiping Liu and Yufan Chen and Kunyu Peng and Chengzhi Wu and Kailun Yang and Jiaming Zhang and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2407.02685},
  year   = {2024}
}

备注

Accepted by ECCV 2024. Project page: https://junweizheng93.github.io/publications/OPS/OPS.html