WidthFormer:迈向高效的基于 Transformer 的 BEV 视角转换
计算机视觉与模式识别
2024-07-31 v5
摘要
我们提出了 WidthFormer,一种新颖的基于 Transformer 的模块,用于从多视角相机计算鸟瞰图(BEV)表示,以用于实时自动驾驶应用。WidthFormer 计算高效、鲁棒,且不需要任何特殊的工程投入即可部署。我们首先引入一种新颖的 3D 位置编码机制,能够准确封装 3D 几何信息,这使得我们的模型仅需单个 Transformer 解码器层即可计算高质量的 BEV 表示。该机制对现有的稀疏 3D 目标检测器也有益。受近期提出的工作启发,我们通过在作为注意力键和值时垂直压缩图像特征来进一步提高模型的效率,随后我们开发了两个模块以补偿特征压缩可能带来的信息损失。在广泛使用的 nuScenes 3D 目标检测基准上的实验评估表明,我们的方法在不同的 3D 检测架构中均优于以往的方法。更重要的是,我们的模型非常高效。例如,当使用 输入图像时,它在 NVIDIA 3090 GPU 和 Horizon Journey-5 计算方案上分别实现了 1.5 ms 和 2.8 ms 的延迟。此外,WidthFormer 对不同程度的相机扰动也表现出很强的鲁棒性。我们的研究为在真实世界复杂道路环境中部署 BEV 转换方法提供了有价值的见解。代码可在 https://github.com/ChenhongyiYang/WidthFormer 获取。
关键词
引用
@article{arxiv.2401.03836,
title = {WidthFormer: Toward Efficient Transformer-based BEV View Transformation},
author = {Chenhongyi Yang and Tianwei Lin and Lichao Huang and Elliot J. Crowley},
journal= {arXiv preprint arXiv:2401.03836},
year = {2024}
}
备注
IROS 2024 Oral Presentation