面向LiDAR点云场景分割的3D可学习超级标记Transformer
计算机视觉与模式识别
2024-12-30 v2
摘要
3D Transformer在点云理解与表示方面取得了很大成功。然而,在大规模LiDAR点云场景分割中,有效且高效的Transformer仍有较大发展空间。本文提出一种新型3D Transformer框架,命名为3D可学习超级标记Transformer(3DLST)。主要贡献总结如下。首先,首次引入动态超级标记优化(Dynamic Supertoken Optimization, DSO)模块,用于高效的标记聚类与聚合,learnable supertoken的定义避免了传统超点生成的耗时预处理。由于可学习的超级标记可通过网络学习中的多层深层特征进行动态优化,因此针对语义同质性感知的标记聚类进行了优化。其次,提出一种高效的基于交叉注意力的升采样(Cross-Attention-guided Upsampling, CAU)模块,用于从优化后的超级标记进行标记重建。最后,3DLST采用新颖的W网络架构代替常用的U网络设计,更适合基于Transformer的特征学习。三组具有挑战性的LiDAR数据集(航空多光谱LiDAR(MS-LiDAR)平均F1分数89.3%,DALES mIoU 80.2%,Toronto-3D数据集mIoU 80.4%)的SOTA性能结果表明了3DLST的优越性及其对各种LiDAR点云数据的强大适应性(包括航空MS-LiDAR、空中LiDAR和车载LiDAR数据)。此外,3DLST在算法效率方面也取得满意的成绩,速度较前所未有的表现方法快达5倍。
引用
@article{arxiv.2405.15826,
title = {3D Learnable Supertoken Transformer for LiDAR Point Cloud Scene Segmentation},
author = {Dening Lu and Jun Zhou and Kyle Gao and Linlin Xu and Jonathan Li},
journal= {arXiv preprint arXiv:2405.15826},
year = {2024}
}
备注
13 pages, 10 figures, 7 tables