面向多模态目标检测的通用融合架构
计算机视觉与模式识别
2025-10-21 v1
摘要
多模态目标检测通过利用来自多个传感器模态的互补线索,在挑战性条件下提高鲁棒性。我们引入Filtered Multi-Modal Cross Attention Fusion (FMCAF),一种旨在增强RGB和红外(IR)输入融合的预处理架构。FMCAF将频域滤波模块(Freq-Filter)用于抑制冗余谱特征,与基于交叉注意力的融合模块(MCAF)结合,以提高跨模态特征共享。不同于针对特定数据集设计的方案,FMCAF旨在实现通用性,在无需数据集特定调优的情况下提升不同多模态挑战下的性能。在LLVIP(低光行人检测)和VEDAI(航空车辆检测)上,FMCAF超越传统融合(拼接),在VEDAI上实现mAP@50提升13.9%,在LLVIP上提升1.1%。这些结果支持FMCAF作为面向未来检测管道中稳健多模态融合的灵活基础的潜力。
引用
@article{arxiv.2510.17078,
title = {Towards a Generalizable Fusion Architecture for Multimodal Object Detection},
author = {Jad Berjawi and Yoann Dupas and Christophe C'erin},
journal= {arXiv preprint arXiv:2510.17078},
year = {2025}
}
备注
8 pages, 8 figures, accepted at ICCV 2025 MIRA Workshop