LATR:基于 Transformer 的单目图像三维车道检测
计算机视觉与模式识别
2023-08-22 v2
摘要
从单目图像进行三维车道检测是自动驾驶中一项基础且具有挑战性的任务。近期进展主要依赖于由前视图像特征和相机参数构建的结构化三维替代表征(如鸟瞰图)。然而,单目图像中的深度模糊不可避免地导致所构建的替代特征图与原始图像之间的错位,给准确的车道检测带来巨大挑战。为解决上述问题,我们提出一种新颖的LATR模型,这是一种端到端的三维车道检测器,使用具有三维感知的前视特征而无需变换视图表征。具体而言,LATR通过基于查询和键值对的交叉注意力来检测三维车道,其中查询和键值对由我们的车道感知查询生成器和动态三维地面位置嵌入构建。一方面,每个查询基于二维车道感知特征生成,并采用混合嵌入以增强车道信息。另一方面,三维空间信息作为位置嵌入从迭代更新的三维地平面注入。LATR在合成Apollo、真实OpenLane和ONCE-3DLanes数据集上均以大幅优势超越先前最先进方法(例如在OpenLane上F1分数提升11.4)。代码将发布于 https://github.com/JMoonr/LATR 。
引用
@article{arxiv.2308.04583,
title = {LATR: 3D Lane Detection from Monocular Images with Transformer},
author = {Yueru Luo and Chaoda Zheng and Xu Yan and Tang Kun and Chao Zheng and Shuguang Cui and Zhen Li},
journal= {arXiv preprint arXiv:2308.04583},
year = {2023}
}
备注
Accepted by ICCV2023 (Oral)