GTNet:用于三维点云分类与语义分割的图 Transformer 网络
计算机视觉与模式识别
2024-08-06 v3
摘要
近年来,基于图和基于 Transformer 的深度学习网络在各种点云任务上展现出了优异的性能。现有大多数图方法基于静态图,以固定输入建立图关系。此外,许多图方法采用最大化与平均来聚合邻域特征,导致仅单个邻域点影响质心特征或不同邻域点对质心特征影响相同,忽略了点间的相关性与差异。大多数基于 Transformer 的方法基于全局注意力提取点云特征,缺乏对局部邻域的特征学习。为解决这两类模型的问题,我们提出一种名为图 Transformer 的新特征提取模块,并构建称为 GTNet 的三维点云学习网络,以在局部与全局模式上学习点云特征。图 Transformer 融合了基于图和基于 Transformer 方法的优势,由局部 Transformer 与全局 Transformer 模块组成。局部 Transformer 使用动态图,通过具有动态更新图关系的域内交叉注意力计算所有邻域点权重,使每个邻域点以不同权重影响质心特征;全局 Transformer 通过全局自注意力扩大局部 Transformer 的感知域。此外,为避免网络加深导致的梯度消失,我们在 GTNet 中对质心特征进行残差连接;我们还在局部 Transformer 中采用质心与邻域特征生成局部几何描述子,以增强模型的局部信息学习能力。最后,本文将 GTNet 用于形状分类、部件分割与语义分割任务。
引用
@article{arxiv.2305.15213,
title = {GTNet: Graph Transformer Network for 3D Point Cloud Classification and Semantic Segmentation},
author = {Wei Zhou and Qian Wang and Weiwei Jin and Xinzhe Shi and Ying He},
journal= {arXiv preprint arXiv:2305.15213},
year = {2024}
}