中文

OneFormer3D:用于统一点云分割的单一 Transformer

计算机视觉与模式识别 2023-11-27 v1

摘要

3D 点云的语义、实例与全景分割一直由设计各异的专用任务模型来处理。由此,所有分割任务之间的相似性及其隐含关联未能得到有效利用。本文提出一种统一、简洁且高效的模型,联合解决上述全部任务。该模型名为 OneFormer3D,使用一组可学习核一致地执行实例与语义分割,其中每个核负责为某个实例或语义类别生成掩码。这些核以一个基于 transformer 的解码器进行训练,该解码器以统一的实例与语义查询作为输入。此类设计支持以单次运行端到端训练模型,从而同时在三项分割任务上取得顶尖性能。具体而言,我们的 OneFormer3D 在 ScanNet 测试榜上排名首位并创下新的最先进水平(+2.1 mAP50)。我们还在 ScanNet(+21 PQ)、ScanNet200(+3.8 mAP50)与 S3DIS(+0.8 mIoU)数据集的语义、实例与全景分割上展示了最先进的结果。

关键词

引用

@article{arxiv.2311.14405,
  title  = {OneFormer3D: One Transformer for Unified Point Cloud Segmentation},
  author = {Maxim Kolodiazhnyi and Anna Vorontsova and Anton Konushin and Danila Rukhovich},
  journal= {arXiv preprint arXiv:2311.14405},
  year   = {2023}
}