用于三维场景实例分割的超点 Transformer
计算机视觉与模式识别
2022-11-30 v1
摘要
现有大多数方法通过扩展用于三维目标检测或三维语义分割的模型来实现三维实例分割。然而,这些非直接方法存在两个缺点:1) 不精确的边界框或不理想的语义预测限制了整体三维实例分割框架的性能。2) 现有方法需要一个耗时的中间聚合步骤。为解决这些问题,本文提出了一种新颖的基于超点 Transformer 的端到端三维实例分割方法,称为 SPFormer。它将点云中的潜在特征聚合成超点,并通过查询向量直接预测实例,无需依赖目标检测或语义分割的结果。该框架的关键步骤是一个新颖的带有 Transformer 的查询解码器,它可以通过超点交叉注意力机制捕获实例信息并生成实例的超点掩码。通过基于超点掩码的二分匹配,SPFormer 无需中间聚合步骤即可实现网络训练,从而加速了网络。在 ScanNetv2 和 S3DIS 基准上的大量实验验证了我们的方法简洁而高效。值得注意的是,SPFormer 在 ScanNetv2 隐藏测试集上的 mAP 指标上以 4.3% 的优势超越了对比的最先进方法,同时保持了快速的推理速度(每帧 247 毫秒)。代码可在 https://github.com/sunjiahao1999/SPFormer 获取。
引用
@article{arxiv.2211.15766,
title = {Superpoint Transformer for 3D Scene Instance Segmentation},
author = {Jiahao Sun and Chunmei Qing and Junpeng Tan and Xiangmin Xu},
journal= {arXiv preprint arXiv:2211.15766},
year = {2022}
}