位置引导的点云全景分割 Transformer
计算机视觉与模式识别
2023-03-24 v1
摘要
DEtection TRansformer(DETR)开启了使用一组可学习查询进行统一视觉感知的趋势。本工作首先将这一吸引人的范式应用于基于 LiDAR 的点云分割,并获得了一个简单而有效的基线。尽管朴素适配取得了尚可的结果,但实例分割性能明显逊于先前工作。通过深入分析细节,我们观察到稀疏点云中的实例相对于整个场景较小,且常具有相似几何但缺乏用于分割的显著外观,这在图像域中很少见。考虑到三维中的实例更多由其位置信息表征,我们在建模过程中强调其作用,并设计了一种鲁棒的混合参数化位置嵌入(MPE)来引导分割过程。它被嵌入到骨干特征中,随后迭代地引导掩码预测与查询更新过程,从而引出位置感知分割(PA-Seg)与掩码焦点注意力(MFA)。所有这些设计促使查询关注特定区域并识别各种实例。该方法被称为位置引导的点云全景分割 Transformer(P3Former),在 SemanticKITTI 和 nuScenes 基准上分别以 3.4% 和 1.2% 的 PQ 优于先前最先进方法。源代码与模型可在 https://github.com/SmartBot-PJLab/P3Former 获取。
引用
@article{arxiv.2303.13509,
title = {Position-Guided Point Cloud Panoptic Segmentation Transformer},
author = {Zeqi Xiao and Wenwei Zhang and Tai Wang and Chen Change Loy and Dahua Lin and Jiangmiao Pang},
journal= {arXiv preprint arXiv:2303.13509},
year = {2023}
}
备注
Project page: https://github.com/SmartBot-PJLab/P3Former