DynStatF:一种用于激光雷达三维目标检测的高效特征融合策略
计算机视觉与模式识别
2023-05-25 v1
摘要
利用多帧历史帧增强激光雷达输入可提供更丰富的语义信息,从而提升三维目标检测性能。然而,多帧中密集的点云会因运动模糊和不准确的点的投影而损害精确的位置信息。本文提出一种新颖的特征融合策略 DynStaF(Dynamic-Static Fusion,动态-静态融合),它利用当前单帧(静态分支)提供的准确位置信息来增强多帧(动态分支)所提供的丰富语义信息。为有效提取并聚合互补特征,DynStaF 包含两个模块——邻域交叉注意力(Neighborhood Cross Attention, NCA)与动态-静态交互(Dynamic-Static Interaction, DSI),通过双通路架构运行。NCA 以静态分支中的特征作为查询(query),以动态分支中的特征作为键(key)与值(value)。在计算注意力时,我们针对点云的稀疏性,仅考虑邻域位置。NCA 在不同特征图尺度上融合两种特征,随后由 DSI 提供全面的交互。为分析所提策略 DynStaF,我们在 nuScenes 数据集上进行了大量实验。在测试集上,DynStaF 将 PointPillars 的 NDS 性能从 57.7% 大幅提升至 61.6%。当与 CenterPoint 结合时,我们的框架取得了 61.0% mAP 和 67.7% NDS,在不加任何花哨技巧的情况下达到了最先进的性能。
引用
@article{arxiv.2305.15219,
title = {DynStatF: An Efficient Feature Fusion Strategy for LiDAR 3D Object Detection},
author = {Yao Rong and Xiangyu Wei and Tianwei Lin and Yueyu Wang and Enkelejda Kasneci},
journal= {arXiv preprint arXiv:2305.15219},
year = {2023}
}
备注
Accepted to CVPR2023 Workshop on End-to-End Autonomous Driving