中文

开放世界全景分割

计算机视觉与模式识别 2024-12-18 v1 机器人学

摘要

感知是自动驾驶视觉系统(如自动驾驶车辆)的关键基础模块。为了安全、鲁棒地运行,这些系统必须能够理解其周围环境。此外,部署在无约束真实世界场景中的自主系统必须能够处理前所未见的新颖情境和物体。在本文中,我们解决开放世界全景分割问题,即在测试时发现新语义类别和新物体实例,同时在增量发现的类别之间保持一致性。我们提出 Con2MAV,一种开放世界全景分割方法,它扩展了我们之前为开放世界语义分割开发的工作 ContMAV。通过在多个数据集上的广泛实验,我们表明我们的模型在开放世界分割任务上取得了SOTA结果,同时在已知类别上仍保持竞争力。论文被接受后我们将开源实现。此外,我们提出 PANIC(Panoptic ANomalies In Context),一个用于评估自动驾驶场景中开放世界全景分割的基准。该数据集使用安装在汽车上的多模态传感器套件记录,提供语义和实例级别上异常物体的高质量像素级标注。我们的数据集包含 800 张图像,超过 50 个未知类别(即训练集中未出现的类别)和 4000 个物体实例,使其成为自动驾驶场景中极具挑战性的开放世界分割任务数据集。我们在隐藏测试集上为多个开放世界任务提供竞赛。我们的数据集和竞赛可在 https://www.ipb.uni-bonn.de/data/panic 获取。

关键词

引用

@article{arxiv.2412.12740,
  title  = {Open-World Panoptic Segmentation},
  author = {Matteo Sodano and Federico Magistri and Jens Behley and Cyrill Stachniss},
  journal= {arXiv preprint arXiv:2412.12740},
  year   = {2024}
}

备注

Submitted to PAMI