DFA3D:用于 2D 到 3D 特征提升的 3D 可变形注意力
计算机视觉与模式识别
2023-07-25 v1
摘要
在本文中,我们提出一种称为 3D 可变形注意力(DFA3D)的新算子,用于 2D 到 3D 特征提升,将多视角 2D 图像特征变换到统一 3D 空间以进行 3D 目标检测。现有的特征提升方法,如基于 Lift-Splat 和基于 2D 注意力的方法,要么使用估计深度获得伪 LiDAR 特征然后将其 splat 到 3D 空间,这是无特征精炼的一次性操作,要么忽略深度并通过 2D 注意力机制提升特征,其获得更细语义但同时受深度模糊问题困扰。相反,我们基于 DFA3D 的方法首先利用估计深度将每视角的 2D 特征图扩展至 3D,然后利用 DFA3D 从扩展的 3D 特征图中聚合特征。借助 DFA3D,深度模糊问题可从根源有效缓解,且提升的特征可因类 Transformer 架构而逐层渐进精炼。此外,我们提出了 DFA3D 的数学等价实现,可显著提升其内存效率与计算速度。我们将 DFA3D 集成到若干使用基于 2D 注意力的特征提升的方法中,仅做少量代码修改,并在 nuScenes 数据集上评估。实验结果显示平均 mAP 稳定提升 +1.41%,在有高质量深度信息时 mAP 提升高达 +15.1%,证明了 DFA3D 的优越性、适用性与巨大潜力。代码见 https://github.com/IDEA-Research/3D-deformable-attention.git。
引用
@article{arxiv.2307.12972,
title = {DFA3D: 3D Deformable Attention For 2D-to-3D Feature Lifting},
author = {Hongyang Li and Hao Zhang and Zhaoyang Zeng and Shilong Liu and Feng Li and Tianhe Ren and Lei Zhang},
journal= {arXiv preprint arXiv:2307.12972},
year = {2023}
}