SGIFormer:面向3D实例分割的语义引导几何增强交错Transformer
计算机视觉与模式识别
2026-02-27 v1
摘要
近年来,基于Transformer的模型在点云实例分割中展现出巨大的潜力。尽管已实现令人瞩目的性能,但现有方法面临实例查询初始化问题和过度依赖堆叠层的问题,使其不适用于大规模3D场景。本文提出一种新方法,命名为SGIFormer,用于3D实例分割,由语义引导混合查询(SMQ)初始化和几何增强交错Transformer(GIT)解码器组成。具体而言,SMQ初始化方案的原理是利用预测的体素级语义信息来隐式生成场景感知查询,产生充分的场景先验并弥补可学习查询集合的不足。随后,我们将所形成的整体查询输入到GIT解码器中,对实例查询和全局场景特征进行交替细化,以进一步捕获细粒度信息并减少复杂设计的细枝。为强调几何属性,我们考虑偏差估计作为辅助任务,并逐步整合偏移点坐标嵌入以强化实例定位。SGIFormer在ScanNet V2、ScanNet200数据集以及具备挑战性的高保真ScanNet++基准上实现了最先进的性能,在准确性和效率之间取得了平衡。代码、模型权重和演示视频均可在https://rayyoh.github.io/sgiformer公开获取。
关键词
引用
@article{arxiv.2407.11564,
title = {SGIFormer: Semantic-guided and Geometric-enhanced Interleaving Transformer for 3D Instance Segmentation},
author = {Lei Yao and Yi Wang and Moyun Liu and Lap-Pui Chau},
journal= {arXiv preprint arXiv:2407.11564},
year = {2026}
}