中文

Point Transformer V2:分组向量注意力与基于分区的池化

计算机视觉与模式识别 2022-10-13 v2

摘要

作为探索 transformer 架构用于三维点云理解的开创性工作,Point Transformer 在多个极具竞争力的基准上取得了令人印象深刻的成果。在本工作中,我们分析 Point Transformer 的局限性,并提出强大且高效的 Point Transformer V2 模型,其新颖设计克服了先前工作的局限。具体而言,我们首先提出分组向量注意力,其比先前版本的向量注意力更有效。继承了可学习权重编码与多头注意力的优势,我们提出了一种高度有效的分组向量注意力实现,带有新颖的分组权重编码层。我们还通过额外的位置编码乘子增强了注意力的位置信息。此外,我们设计了新颖且轻量的基于分区的池化方法,可实现更好的空间对齐与更高效的采样。大量实验表明,我们的模型比其前身性能更优,并在若干具挑战性的三维点云理解基准上达到最先进水平,包括 ScanNet v2 与 S3DIS 上的三维点云分割以及 ModelNet40 上的三维点云分类。我们的代码将发布于 https://github.com/Gofinge/PointTransformerV2。

关键词

引用

@article{arxiv.2210.05666,
  title  = {Point Transformer V2: Grouped Vector Attention and Partition-based Pooling},
  author = {Xiaoyang Wu and Yixing Lao and Li Jiang and Xihui Liu and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2210.05666},
  year   = {2022}
}

备注

Accepted at NeurIPS 2022