中文

AutoAlignV2:面向动态多模态三维目标检测的可变形特征聚合

计算机视觉与模式识别 2022-07-22 v1

摘要

点云与 RGB 图像是自动驾驶中两种通用的感知来源。前者可提供物体的精确定位,后者在语义信息上更密集且更丰富。近期,AutoAlign 提出了一种可学习的范式来结合这两种模态进行三维目标检测。然而,它受到全局注意力引入的高计算成本所困扰。为解决该问题,我们在本工作中提出跨域可变形 CAFA(Cross-Domain DeformCAFA)模块。它关注稀疏可学习采样点以进行跨模态关系建模,增强了对标定误差的容忍度,并大幅加速了跨模态特征聚合。为克服多模态设置下复杂的 GT-AUG,我们设计了一种简单而有效的跨模态增强策略,基于给定深度信息的图像块凸组合。此外,通过实施一种新颖的图像级丢弃训练方案,我们的模型能够以动态方式推理。为此,我们提出 AutoAlignV2,一种更快且更强的多模态三维检测框架,构建于 AutoAlign 之上。在 nuScenes 基准上的大量实验证明了 AutoAlignV2 的有效性与高效性。值得注意的是,我们的最佳模型在 nuScenes 测试排行榜上达到 72.4 NDS,在所有已发布的多模态三维目标检测器中取得新的 SOTA 结果。代码将发布于 https://github.com/zehuichen123/AutoAlignV2。

关键词

引用

@article{arxiv.2207.10316,
  title  = {AutoAlignV2: Deformable Feature Aggregation for Dynamic Multi-Modal 3D Object Detection},
  author = {Zehui Chen and Zhenyu Li and Shiquan Zhang and Liangji Fang and Qinhong Jiang and Feng Zhao},
  journal= {arXiv preprint arXiv:2207.10316},
  year   = {2022}
}

备注

Accepted to ECCV 2022