中文

PanSt3R:多视图一致的全景分割

计算机视觉与模式识别 2025-06-27 v1

摘要

对 3D 场景的全景分割——即对场景密集 3D 重建中对象实例的分割与分类——是一个具有挑战性的问题,尤其是当仅依赖未标定的 2D 图像时。现有方法通常利用即插即用模型提取每帧的 2D 全景分割,然后优化隐式几何表示(通常基于 NeRF)以整合和融合 2D 预测。在此基础上,我们认为对于本质上是 3D 且多视角的问题,仅依赖 2D 全景分割显然不够优化,因其未能充分利用跨视角的空间关系。此外,这些方法也需要相机参数,并要求针对每个场景进行计算昂贵的测试时优化。相反,本工作提出了统一且集成的方法 PanSt3R,通过单次前向传播联合预测 3D 几何与多视角全景分割,无需测试时优化。我们的做法基于近期在 3D 重建方面的进展,具体是基于 MUSt3R 的方法——该方法是 DUSt3R 的可扩展多视角版本——并增强了其语义感知能力和多视角全景分割功能。我们还重新审视了标准后处理掩码合并程序,提出了更原则的方法进行多视角分割。我们 additionally 引入了一种简单方法,用于基于 PanSt3R 和 vanilla 3DGS 的预测生成新视角预测。总体而言,提出的 PanSt3R 概念简单却快速且可扩展,实现了多个基准测试中的最先进性能,速度比现有方法快了几个数量级。

关键词

引用

@article{arxiv.2506.21348,
  title  = {PanSt3R: Multi-view Consistent Panoptic Segmentation},
  author = {Lojze Zust and Yohann Cabon and Juliette Marrie and Leonid Antsfeld and Boris Chidlovskii and Jerome Revaud and Gabriela Csurka},
  journal= {arXiv preprint arXiv:2506.21348},
  year   = {2025}
}

备注

Accepted at ICCV 2025