中文

EVT: 面向多模态 3D 目标检测的高效视图变换

计算机视觉与模式识别 2025-07-14 v4

摘要

鸟瞰图(BEV)表征下的多模态传感器融合已成为 3D 目标检测的主流范式。然而,现有方法常依赖深度估计器或 Transformer 编码器将图像特征变换到 BEV 空间,这会降低鲁棒性或引入显著计算开销。此外,视图变换中几何引导不足导致射线方向错位,限制了 BEV 表征的有效性。为应对这些挑战,我们提出高效视图变换(EVT),一种新颖的 3D 目标检测框架,构建结构良好的 BEV 表征,同时提升精度与效率。我们的方法聚焦两个关键方面。第一,自适应采样与自适应投影(ASAP),利用 LiDAR 引导生成 3D 采样点与自适应核,实现图像特征到 BEV 空间的更有效变换及更精细的 BEV 表征。第二,改进的基于查询的检测框架,融入分组混合查询选择与几何感知交叉注意力,在 Transformer 解码器中有效捕捉目标的共性属性与几何结构。在 nuScenes 测试集上,EVT 以实时推理速度达到 75.3% NDS 的最先进性能。

关键词

引用

@article{arxiv.2411.10715,
  title  = {EVT: Efficient View Transformation for Multi-Modal 3D Object Detection},
  author = {Yongjin Lee and Hyeon-Mun Jeong and Yurim Jeon and Sanghyun Kim},
  journal= {arXiv preprint arXiv:2411.10715},
  year   = {2025}
}

备注

Accepted to ICCV 2025