GPSFormer:基于全局感知与局部结构拟合的点云理解 Transformer
计算机视觉与模式识别
2024-07-25 v2
摘要
尽管在点云理解领域已取得显著进展,但直接从不规则点云中无需依赖外部数据即可捕捉细致形状信息仍是一 formidable 挑战。为此,我们提出GPSFormer,一种创新的 Global Perception(全局感知)和 Local Structure Fitting-based Transformer,能够以卓越的精度从点云中学习详细的形状信息。GPSFormer的核心是 Global Perception Module(GPM)和 Local Structure Fitting Convolution(LSFConv)。具体而言,GPM利用自适应可变形图卷积(ADGConv)识别特征空间中相似特征之间的短程依赖关系,并采用多头注意力(MHA)学习特征空间中所有位置之间的长程依赖关系,从而实现对上下文表示的灵活学习。灵感来源于泰勒级数,我们设计了LSFConv,该模块从显式编码的局部几何结构中学习低阶基本信息和高阶细化信息。将GPM和LSFConv作为基本组件,我们构建了GPSFormer,一种先进的Transformer,有效捕获点云的全局和局部结构。广泛的实验验证了GPSFormer在三个点云任务中的有效性:形状分类、零件分割和few-shot学习。GPSFormer的代码可在\url{https://github.com/changshuowang/GPSFormer} 找到。
引用
@article{arxiv.2407.13519,
title = {GPSFormer: A Global Perception and Local Structure Fitting-based Transformer for Point Cloud Understanding},
author = {Changshuo Wang and Meiqing Wu and Siew-Kei Lam and Xin Ning and Shangshu Yu and Ruiping Wang and Weijun Li and Thambipillai Srikanthan},
journal= {arXiv preprint arXiv:2407.13519},
year = {2024}
}
备注
Accepted by ECCV 2024