Mask3D:用于三维语义实例分割的掩码Transformer
计算机视觉与模式识别
2023-04-13 v2
摘要
现代的三维语义实例分割方法主要依赖于专门的投票机制,以及精心设计的几何聚类技术。基于近期基于Transformer的目标检测和图像分割方法的成功,我们提出了首个基于Transformer的三维语义实例分割方法。我们展示了可以利用通用的Transformer构建模块直接从三维点云预测实例掩码。在我们称为Mask3D的模型中,每个目标实例由一个实例查询表示。使用Transformer解码器,实例查询通过迭代地关注多尺度的点云特征来学习。结合点特征,实例查询直接并行地生成所有实例掩码。Mask3D相对于当前最先进的方法具有若干优势,因为它既不依赖于(1)需要手工选取几何属性(如中心)的投票方案,也不依赖于(2)需要手动调节超参数(如半径)的几何分组机制,并且(3)支持直接优化实例掩码的损失。Mask3D在ScanNet测试集(+6.2 mAP)、S3DIS六折交叉(+10.1 mAP)、STPLS3D(+11.2 mAP)和ScanNet200测试集(+12.4 mAP)上确立了新的最先进水平。
引用
@article{arxiv.2210.03105,
title = {Mask3D: Mask Transformer for 3D Semantic Instance Segmentation},
author = {Jonas Schult and Francis Engelmann and Alexander Hermans and Or Litany and Siyu Tang and Bastian Leibe},
journal= {arXiv preprint arXiv:2210.03105},
year = {2023}
}
备注
ICRA 2023 camera-ready version