中文

3D 点云中的 Transformer:综述

计算机视觉与模式识别 2022-09-22 v2

摘要

Transformer 一直处于自然语言处理 (NLP) 和计算机视觉 (CV) 革命的核心。NLP 和 CV 中的显著成功启发了在 point cloud 处理中探索 Transformer 的使用。然而,Transformer 如何应对点云的不规则性和无序性?Transformer 对于不同的 3D 表示(例如,基于点或基于体素)有多合适?Transformer 对于各种 3D 处理任务有多胜任?截至目前,关于这些问题的研究仍无系统综述。我们首次提供了针对日益流行的用于 3D 点云分析的 Transformer 的全面概述。我们首先介绍 Transformer 架构的理论并回顾其在 2D/3D 领域的应用。然后,我们提出三种不同的分类法(即基于实现、基于数据表示和基于任务),可从多个角度对当前基于 Transformer 的方法进行分类。此外,我们展示了针对 3D 中自注意力机制的变体和改进的调研结果。为证明 Transformer 在点云分析中的优越性,我们给出了用于分类、分割和对象检测的各种基于 Transformer 的方法的综合比较。最后,我们提出三个潜在的研究方向,为 3D Transformer 的发展提供有益参考。

关键词

引用

@article{arxiv.2205.07417,
  title  = {Transformers in 3D Point Clouds: A Survey},
  author = {Dening Lu and Qian Xie and Mingqiang Wei and Kyle Gao and Linlin Xu and Jonathan Li},
  journal= {arXiv preprint arXiv:2205.07417},
  year   = {2022}
}

备注

20 pages, 5 figures, 4 tables