FAST3DIS:面向3D实例分割的前馈锚定场景转换器
计算机视觉与模式识别
2026-03-30 v1
摘要
虽然最近的前馈式3D重建模型为场景理解提供了强大的几何基础,但将其扩展到3D实例分割通常依赖于非连续的“升格-聚类”范式。通过非可微聚类对稠密像素级嵌入进行分组,随着视角数量的增加而扩展性能力差,并使表示学习与最终分割目标断开。在本文中,我们提出了一种用于3D实例分割的Feed-forward Anchored Scene Transformer (FAST3DIS),这是一种有效绕过后处理聚类的端到端方法。我们引入了一个基于基础深度主干网络的3D锚定、查询驱动的Transformer架构,高效地适应以学习实例特定语义,同时保留其零样本几何先验。我们构建了学习的3D锚点生成器,结合锚点采样交叉注意力机制,以实现视角一致的3D实例分割。通过将3D对象查询直接投影到多视角特征图上, our方法高效地采样了上下文。此外,我们引入了双层正则化策略,将多视角对比学习与动态调度的空间重叠惩罚相耦合,以显式防止查询碰撞,确保精确的实例边界。在复杂室内3D数据集上的实验表明,我们的方法在显著提升内存可扩展性和推理速度的同时,以与当前聚类方法相媲美的分割精度。
关键词
引用
@article{arxiv.2603.25993,
title = {FAST3DIS: Feed-forward Anchored Scene Transformer for 3D Instance Segmentation},
author = {Changyang Li and Xueqing Huang and Shin-Fang Chng and Huangying Zhan and Qingan Yan and Yi Xu},
journal= {arXiv preprint arXiv:2603.25993},
year = {2026}
}