中文

ConDaFormer:用于 3D 点云理解的局部结构增强解耦 Transformer

计算机视觉与模式识别 2023-12-19 v1

摘要

近期,Transformer 被探索用于 3D 点云理解并取得了令人瞩目的进展。由于点数量庞大(超过 10 万个),全局自注意力对点云数据不可行。因此,大多数方法提出在局部区域(如球形或立方体窗口)内应用 Transformer。然而,这仍然包含大量的 Query-Key 对,需要高昂的计算成本。此外,以往方法通常使用线性投影来学习查询、键和值,而未对局部 3D 几何结构进行建模。在本文中,我们试图通过开发一种名为 ConDaFormer 的新型 Transformer 块来降低成本并建模局部几何先验。在技术上,ConDaFormer 将立方体窗口解耦为三个正交的 2D 平面,从而在建模相似范围内的注意力时涉及更少的点。解耦操作有利于在不增加计算复杂度的情况下扩大注意力范围,但会忽略部分上下文。作为补救,我们开发了一种局部结构增强策略,在注意力机制前后引入深度卷积。该方案也能捕获局部几何信息。得益于这些设计,ConDaFormer 同时捕获了长程上下文信息和局部先验。在多个 3D 点云理解基准上的实验结果证明了其有效性。代码可在 https://github.com/LHDuan/ConDaFormer 获取。

关键词

引用

@article{arxiv.2312.11112,
  title  = {ConDaFormer: Disassembled Transformer with Local Structure Enhancement for 3D Point Cloud Understanding},
  author = {Lunhao Duan and Shanshan Zhao and Nan Xue and Mingming Gong and Gui-Song Xia and Dacheng Tao},
  journal= {arXiv preprint arXiv:2312.11112},
  year   = {2023}
}

备注

NeurIPS 2023. Code: https://github.com/LHDuan/ConDaFormer