用于点云理解的自定位基于点的 Transformer
计算机视觉与模式识别
2023-03-30 v1
摘要
Transformer 凭借捕获长程依赖的能力,已在多种计算机视觉任务上展现出优越性能。尽管取得成功,由于在点数上的二次方代价,直接将 Transformer 应用于点云具有挑战性。本文中,我们提出一种自定位基于点的 Transformer(SPoTr),旨在以更低的复杂度捕获局部与全局形状上下文。具体而言,该架构由局部自注意力与自定位基于点的全局交叉注意力组成。自定位点基于输入形状自适应定位,通过解耦注意力兼顾空间与语义信息以提升表达能力。借助自定位点,我们提出一种新颖的面向点云的全局交叉注意力机制,其通过使注意力模块仅与一小部分自定位点计算注意力权重,改善了全局自注意力的可扩展性。实验展示了 SPoTr 在形状分类、部件分割与场景分割三个点云任务上的有效性。特别地,我们提出的模型在 ScanObjectNN 的形状分类上比先前最佳模型准确率提升 2.6%。我们还提供定性分析以展示自定位点的可解释性。SPoTr 的代码见于 https://github.com/mlvlab/SPoTr。
引用
@article{arxiv.2303.16450,
title = {Self-positioning Point-based Transformer for Point Cloud Understanding},
author = {Jinyoung Park and Sanghyeok Lee and Sihyeon Kim and Yunyang Xiong and Hyunwoo J. Kim},
journal= {arXiv preprint arXiv:2303.16450},
year = {2023}
}
备注
Accepted paper at CVPR 2023