IPFormer:基于上下文自适应实例提议的视觉3D全景场景完成
计算机视觉与模式识别
2026-01-27 v3
摘要
语义场景完成(SSC)已成为联合学习场景几何与语义信息的关键方法,能够支持移动机器人导航等下游应用。最近的全景场景完成(PSC)方法在SSC领域取得进展,通过集成实例级信息,增强了场景理解中对对象的敏感性。虽然PSC最初使用LiDAR模态,但基于相机图像的方法仍鲜有探索。此外,最近的基于Transformer的方法使用固定的学习查询集合来重建场景中的对象。虽然这些查询在训练时通常会结合图像上下文进行更新,但在测试时保持静态,限制了其针对特定观察场景的动态适应能力。为克服这些限制,我们提出了IPFormer——首个在训练和测试时利用上下文自适应实例提议来解决视觉基于3D全景场景完成的方法。具体而言,IPFormer自适应地将这些查询初始化为从图像上下文中派生的全景实例提议,并通过基于注意力的编码和解码来推理语义实例体素关系。大量实验结果表明,我们的方法在原分布内实现了最新的性能,在分布外数据上展现出优异的零样本泛化能力,并实现了超过14倍的运行时缩减。这些结果突显了我们首次引入上下文自适应实例提议作为解决视觉3D全景场景完成的开创性工作。代码已公开:https://github.com/markus-42/ipformer。
引用
@article{arxiv.2506.20671,
title = {IPFormer: Visual 3D Panoptic Scene Completion with Context-Adaptive Instance Proposals},
author = {Markus Gross and Aya Fahmy and Danit Niwattananan and Dominik Muhle and Rui Song and Daniel Cremers and Henri Meeß},
journal= {arXiv preprint arXiv:2506.20671},
year = {2026}
}