中文

ScatterFormer:具有分散线性注意力的高效体素Transformer

计算机视觉与模式识别 2024-07-19 v2

摘要

基于窗口的Transformer通过以更局部的方式以可承受的注意力计算捕获上下文感知表示,在大规模点云理解中表现出色。然而,点云的稀疏性导致每个窗口中的体素数量存在显著差异。现有方法通过大量的排序和填充操作将每个窗口中的体素分组为固定长度的序列,导致不可忽略的计算和内存开销。在本文中,我们介绍了ScatterFormer,据我们所知,这是第一个直接将注意力应用于跨不同窗口的体素作为单个序列的方法。ScatterFormer的关键是分散线性注意力(SLA)模块,它利用线性注意力中键值对的预计算,对按窗口划分的可变长度体素序列进行并行计算。利用GPU的分层结构和共享内存,我们提出了一种分块算法,将SLA模块的延迟降低到中等GPU上不到1毫秒。此外,我们开发了一个跨窗口交互模块,改善了不同窗口间体素特征的局部性和连通性,消除了对大量窗口移位的需求。我们提出的ScatterFormer在Waymo开放数据集上达到73.8 mAP(L2),在NuScenes数据集上达到72.4 NDS,以23 FPS的出色检测率运行。代码可在\href{https://github.com/skyhehe123/ScatterFormer}{https://github.com/skyhehe123/ScatterFormer}获取。

关键词

引用

@article{arxiv.2401.00912,
  title  = {ScatterFormer: Efficient Voxel Transformer with Scattered Linear Attention},
  author = {Chenhang He and Ruihuang Li and Guowen Zhang and Lei Zhang},
  journal= {arXiv preprint arXiv:2401.00912},
  year   = {2024}
}

备注

14 pages, 6 figures, Accepted to ECCV2024