基于参数化深度的特征表示学习用于鸟瞰图下的目标检测与分割
计算机视觉与模式识别
2023-07-13 v2
摘要
近期用于自动驾驶的纯视觉感知模型通过将多视角图像特征编码到鸟瞰图(BEV)空间取得了有前景的结果。这些方法的关键步骤和主要瓶颈是将图像特征变换到 BEV 坐标系。本文聚焦于利用深度等几何信息来建模此类特征变换。现有工作依赖非参数化深度分布建模导致显著的内存消耗,或忽略几何信息以解决该问题。相比之下,我们提出使用参数化深度分布建模进行特征变换。我们首先通过为每个视角中每个像素预测的参数化深度分布将 2D 图像特征提升到为自车定义的 3D 空间。然后,我们基于由深度导出的 3D 空间占据情况将 3D 特征体聚合到 BEV 坐标系。最后,我们使用变换后的特征进行下游任务,如目标检测和语义分割。现有语义分割方法也因未考虑可见性信息而遭受幻觉问题。这种幻觉对后续模块(如控制与规划)可能尤其有害。为缓解该问题,我们的方法提供深度不确定性和可靠的可见性感知估计。我们进一步利用参数化深度建模提出一种新颖的可见性感知评估指标,在考虑该指标时可缓解幻觉问题。在 nuScenes 数据集上针对目标检测和语义分割的大量实验表明,我们的方法在两项任务上均优于现有方法。
引用
@article{arxiv.2307.04106,
title = {Parametric Depth Based Feature Representation Learning for Object Detection and Segmentation in Bird's Eye View},
author = {Jiayu Yang and Enze Xie and Miaomiao Liu and Jose M. Alvarez},
journal= {arXiv preprint arXiv:2307.04106},
year = {2023}
}