3DGTN:用于点云分类与分割的三维双注意力全局-局部 Transformer 网络
计算机视觉与模式识别
2023-06-01 v2
摘要
尽管 Transformer 在三维点云处理中的应用已取得显著进展与成功,现有三维 Transformer 方法仍难以高效且准确地学习有价值的全局特征与有价值的局部特征以改进应用。本文提出一种新颖的点云表示学习网络,称为三维双自注意力全局-局部(GLocal)Transformer 网络(3DGTN),用于在分类与分割任务中改进特征学习,具有以下关键贡献。首先,设计了一个带有双自注意力机制(即一种新颖的点-块自注意力 PPSA 与通道级自注意力)的 GLocal 特征学习(GFL)模块,以高效学习 GLocal 上下文信息。其次,将 GFL 模块与基于多尺度图卷积的局部特征聚合(LFA)模块相整合,形成可高效捕获关键信息的全局-局部(GLocal)信息提取模块。第三,使用一系列 GLocal 模块构建新的分层编码器-解码器结构,以分层方式实现不同尺度下“GLocal”信息的学习。所提框架在分类与分割数据集上进行了评估,表明该方法在分类与分割任务上均能超越许多 SOTA 方法。
引用
@article{arxiv.2209.11255,
title = {3DGTN: 3D Dual-Attention GLocal Transformer Network for Point Cloud Classification and Segmentation},
author = {Dening Lu and Kyle Gao and Qian Xie and Linlin Xu and Jonathan Li},
journal= {arXiv preprint arXiv:2209.11255},
year = {2023}
}
备注
10 pages, 6 figures, 4 tables