FlatFormer:面向高效点云Transformer的扁平化窗口注意力
计算机视觉与模式识别
2023-07-18 v3
摘要
Transformer作为CNN的替代方案,已在多种模态(如文本与图像)中被证明有效。对于3D点云Transformer,现有工作主要聚焦于将其精度推至最先进水平。然而,其延迟落后于基于稀疏卷积的模型(慢3倍),阻碍了它们在资源受限、延迟敏感的应用(如自动驾驶)中的使用。这一低效源于点云的稀疏与非规则特性,而Transformer是为稠密、规则负载设计的。本文提出FlatFormer,通过以空间邻近性换取更好的计算规则性来缩小这一延迟差距。我们首先利用基于窗口的排序将点云扁平化,并将点划分为等大小组而非等形状窗口。这有效避免了昂贵的结构化与填充开销。我们随后在组内施加自注意力以提取局部特征,交替排序轴以从不同方向聚合特征,并平移窗口以跨组交换特征。FlatFormer在Waymo Open Dataset上取得最先进精度,较(基于Transformer的)SST加速4.6倍,较(稀疏卷积的)CenterPoint加速1.4倍。这是首个在边缘GPU上实现实时性能、且快于稀疏卷积方法同时在大规模基准上达到相当甚至更优精度的点云Transformer。
引用
@article{arxiv.2301.08739,
title = {FlatFormer: Flattened Window Attention for Efficient Point Cloud Transformer},
author = {Zhijian Liu and Xinyu Yang and Haotian Tang and Shang Yang and Song Han},
journal= {arXiv preprint arXiv:2301.08739},
year = {2023}
}
备注
CVPR 2023. The first two authors contributed equally to this work. Project page: https://flatformer.mit.edu