面向端到端同步多模态融合检测的 E2E-MFD 方法
计算机视觉与模式识别
2025-01-28 v4
摘要
多模态图像融合和目标检测是自动驾驶的关键任务。虽然当前方法已推进了纹理细节和语义信息的融合,但其复杂的训练过程阻碍了更广泛的应用。为此,我们引入 E2E-MFD,一种新的端到端算法用于多模态融合检测。E2E-MFD 实现了单一训练阶段的高性能。它采用跨组件的同步联合优化,以避免与单独任务相关的亚最优解。此外,它在共享参数的梯度矩阵中实施全面的优化策略,确保收敛到最优的融合检测配置。我们在多个公开数据集上进行了广泛测试,结果显示 E2E-MFD 不仅在视觉上呈现出引人注目的图像融合,而且在检测方面也表现出色,例如相对于最先进的方法,在水平目标检测数据集 M3FD 和倾斜目标检测数据集 DroneVehicle 上分别实现了 3.9% 和 2.0% 的 mAP50 提升。代码已发布于 https://github.com/icey-zhang/E2E-MFD。
引用
@article{arxiv.2403.09323,
title = {E2E-MFD: Towards End-to-End Synchronous Multimodal Fusion Detection},
author = {Jiaqing Zhang and Mingxiang Cao and Weiying Xie and Jie Lei and Daixun Li and Wenbo Huang and Yunsong Li and Xue Yang},
journal= {arXiv preprint arXiv:2403.09323},
year = {2025}
}