中文

DV-3DLane:基于双视图表示的端到端多模态 3D 车道检测框架

计算机视觉与模式识别 2024-06-25 v1

摘要

精准的 3D 车道估计对于确保自动驾驶安全至关重要。然而,现有的单目技术受深度损失和光照变化影响,致使难以实现准确的 3D 车道检测。相比之下,LiDAR 点提供几何线索,实现精确定位。在本文中,我们提出 DV-3DLane,一种 novel 的端到端双视图多模态 3D 车道检测框架,协同利用图像和 LiDAR 点的优势。我们提议在双视图空间(即透视视图 PV 和鸟瞰视图 BEV)中学习多模态特征,有效利用各模态特有的信息。为实现此目标,我们引入三项设计:1)双向特征融合策略,将多模态特征整合到每个视图空间中,挖掘其独特优势。2)统一的查询生成方法,利用 PV 和 BEV 空间中的车道相关知识生成查询。3)3D 双视图可变形注意力机制,将来自 PV 和 BEV 空间中具辨识力的特征聚合到查询中,以实现准确的 3D 车道检测。在公开基准数据集 OpenLane 上的大量实验表明,DV-3DLane 的有效性和效率。它在 F1 分数上实现了显著的 11.2 提升,错误率降低了 53.5%。代码地址为 \url{https://github.com/JMoonr/dv-3dlane}。

关键词

引用

@article{arxiv.2406.16072,
  title  = {DV-3DLane: End-to-end Multi-modal 3D Lane Detection with Dual-view Representation},
  author = {Yueru Luo and Shuguang Cui and Zhen Li},
  journal= {arXiv preprint arXiv:2406.16072},
  year   = {2024}
}

备注

Accepted at ICLR2024