VIMI:基于相机三维目标检测的车路多视角中间融合方法
计算机视觉与模式识别
2023-03-21 v1
摘要
在自动驾驶中,车路协同三维目标检测(VIC3D)利用来自车辆与交通基础设施的多视角相机,提供超越单一车辆视角的全局优势点及丰富的道路语义上下文。VIC3D面临两大挑战:1)融合多视角图像时因相机间时间异步导致的固有标定噪声;2)将2D特征投影至3D空间时的信息损失。为解决这些问题,我们提出一种新颖的三维目标检测框架——车路多视角中间融合(VIMI)。首先,为充分挖掘车辆与基础设施的整体视角,我们提出多尺度交叉注意力(MCA)模块,在选择性多尺度上融合基础设施与车辆特征,以校正相机异步引入的标定噪声。随后,我们设计相机感知通道掩码(CCM)模块,利用相机参数作为先验来增强融合特征。我们进一步引入具有通道与空间压缩块的特征压缩(FC)模块,以减小传输特征规模从而提升效率。实验表明,VIMI在新VIC3D数据集DAIR-V2X-C上取得15.61%的总体AP_3D与21.44%的AP_BEV,以可比传输成本显著优于最先进的早期融合与晚期融合方法。
引用
@article{arxiv.2303.10975,
title = {VIMI: Vehicle-Infrastructure Multi-view Intermediate Fusion for Camera-based 3D Object Detection},
author = {Zhe Wang and Siqi Fan and Xiaoliang Huo and Tongda Xu and Yan Wang and Jingjing Liu and Yilun Chen and Ya-Qin Zhang},
journal= {arXiv preprint arXiv:2303.10975},
year = {2023}
}
备注
8 pages, 9 figures