中文

Prior2Former —— 基于证据学习的掩码变换器建模用于无假设开放世界全景分割

计算机视觉与模式识别 2025-08-06 v2

摘要

在全景分割中,必须在语义类别内部分离 individual 实例。由于领先的方法依赖于预定义的类别集合,因此在处理新类别和分布外(OOD)数据时受限。这在安全关键应用中尤为突出,如自动驾驶,需在未见情景中保持可靠性。我们通过提出Prior2Former(P2F)来弥合优异基准性能与可靠性之间的差距,这是首个基于证据学习的分割视觉变换器方法。P2F通过在像素级二值掩码分配中引入Beta先验来计算模型不确定性,从而扩展了掩码视觉变换器架构。此设计实现了高质量的不确定性估计,有效检测新奇和OOD对象,实现了最先进的异常实例分割和开放世界全景分割。与大多数处理未知类别的分割模型不同,P2F无需访问OOD数据样本或对void(即无标签)类别进行对比训练,因而在实际场景中高度适用。此外,P2F可灵活应用于异常实例和全景分割。通过在Cityscapes、COCO、SegmentMeIfYouCan和OoDIS数据集上的全面实验,P2F在所有指标上均实现了最先进的性能。

关键词

引用

@article{arxiv.2504.04841,
  title  = {Prior2Former -- Evidential Modeling of Mask Transformers for Assumption-Free Open-World Panoptic Segmentation},
  author = {Sebastian Schmidt and Julius Körner and Dominik Fuchsgruber and Stefano Gasperini and Federico Tombari and Stephan Günnemann},
  journal= {arXiv preprint arXiv:2504.04841},
  year   = {2025}
}