EMIFF:用于车路协同 3D 目标检测的增强型多尺度图像特征融合
计算机视觉与模式识别
2024-02-26 v1 人工智能
摘要
在自动驾驶中,协同感知利用来自车辆和基础设施的多视角相机,提供超越单车视角的具有丰富道路条件语义上下文的全局视点。目前,车路协同 3D(VIC3D)目标检测面临两大主要挑战:1) 由于相机间时间不同步导致融合多视角图像时存在固有的位姿误差;2) 受限于通信带宽导致传输过程中的信息丢失。为解决这些问题,我们提出了一种用于 VIC3D 任务的新型基于相机的 3D 检测框架:增强型多尺度图像特征融合(EMIFF)。为了充分利用车辆和基础设施的整体视角,我们提出了多尺度交叉注意力(MCA)和相机感知通道掩码(CCM)模块,以在尺度、空间和通道层面增强基础设施和车辆特征,从而校正由相机不同步引入的位姿误差。我们还引入了一个具有通道和空间压缩块的特征压缩(FC)模块,以提高传输效率。实验表明,EMIFF 在 DAIR-V2X-C 数据集上达到了 SOTA 水平,在传输成本相当的情况下,显著优于早期的早期融合和晚期融合方法。
引用
@article{arxiv.2402.15272,
title = {EMIFF: Enhanced Multi-scale Image Feature Fusion for Vehicle-Infrastructure Cooperative 3D Object Detection},
author = {Zhe Wang and Siqi Fan and Xiaoliang Huo and Tongda Xu and Yan Wang and Jingjing Liu and Yilun Chen and Ya-Qin Zhang},
journal= {arXiv preprint arXiv:2402.15272},
year = {2024}
}
备注
7 pages, 8 figures. Accepted by ICRA 2024. arXiv admin note: text overlap with arXiv:arXiv:2303.10975