中文

面向三维目标检测的同质多模态特征融合与交互

计算机视觉与模式识别 2022-10-19 v1

摘要

多模态三维目标检测一直是自动驾驶中的活跃研究课题。然而,探索稀疏三维点与稠密二维像素之间的跨模态特征融合并非易事。现有方法或将图像特征与投影到二维图像平面的点云特征融合,或将稀疏点云与稠密图像像素结合。这些融合方法常遭受严重的信息损失,从而导致次优性能。为解决这些问题,我们通过将相机特征变换到 LiDAR 三维空间中,构建点云与图像之间的同质结构以避免投影信息损失。本文提出一种面向三维目标检测的同质多模态特征融合与交互方法(HMFI)。具体而言,我们首先设计图像体素提升模块(IVLM)将二维图像特征提升到三维空间并生成同质图像体素特征。随后,通过引入基于自注意力的查询融合机制(QFM),将体素化点云特征与来自不同区域的图像特征融合。接下来,我们提出体素特征交互模块(VFIM)以增强同质点云与图像体素表示中同一物体语义信息的一致性,从而为跨模态特征融合提供物体级对齐引导,并强化在复杂背景下的判别能力。我们在 KITTI 与 Waymo Open Dataset 上进行了大量实验,所提出的 HMFI 相比最先进的多模态方法取得了更优性能。尤其在 KITTI 基准上的骑行者三维检测中,HMFI 大幅超越所有已发表算法。

关键词

引用

@article{arxiv.2210.09615,
  title  = {Homogeneous Multi-modal Feature Fusion and Interaction for 3D Object Detection},
  author = {Xin Li and Botian Shi and Yuenan Hou and Xingjiao Wu and Tianlong Ma and Yikang Li and Liang He},
  journal= {arXiv preprint arXiv:2210.09615},
  year   = {2022}
}

备注

Accepted by ECCV 2022