中文

消除 BEV 空间中的跨模态冲突以用于 LiDAR-相机 3D 物体检测

计算机视觉与模式识别 2024-03-13 v1

摘要

最近的 3D 物体检测器通常利用多传感器数据,并在共享的鸟瞰图(BEV)表示空间中统一多模态特征。然而,我们的实证研究表明,以往方法在生成无跨模态冲突的融合 BEV 特征方面存在局限性。这些冲突包括由 BEV 特征构建引起的外部冲突,以及由异构传感器信号引起的固有冲突。因此,我们提出了一种新颖的消除冲突融合(Eliminating Conflicts Fusion, ECFusion)方法,以显式消除 BEV 空间中的外部和固有冲突,并生成改进的多模态 BEV 特征。具体而言,我们设计了一个语义引导的基于流的对齐(Semantic-guided Flow-based Alignment, SFA)模块,通过在融合前统一 BEV 空间中的空间分布来解决外部冲突。此外,我们设计了一种溶解查询恢复(Dissolved Query Recovering, DQR)机制,通过保留在融合 BEV 特征中丢失的物体性线索来补救固有冲突。总体而言,我们的方法最大化了每种模态的有效信息利用,并利用了模态间的互补性。我们的方法在竞争激烈的 nuScenes 3D 物体检测数据集中实现了最先进的性能。代码发布于 https://github.com/fjhzhixi/ECFusion。

关键词

引用

@article{arxiv.2403.07372,
  title  = {Eliminating Cross-modal Conflicts in BEV Space for LiDAR-Camera 3D Object Detection},
  author = {Jiahui Fu and Chen Gao and Zitian Wang and Lirong Yang and Xiaofei Wang and Beipeng Mu and Si Liu},
  journal= {arXiv preprint arXiv:2403.07372},
  year   = {2024}
}

备注

Accepted by ICRA 2024