中文

UAVD-Mamba:面向多模态无人机目标检测的可变形Token融合视觉Mamba

计算机视觉与模式识别 2025-07-02 v1

摘要

无人机 (UAV) 目标检测已广泛应用于交通管理、农业、应急救援等领域。然而,它面临着遮挡、小目标尺寸和不规则形状等显著挑战。这些挑战凸显了对稳健且高效的多模态无人机目标检测方法的必要性。Mamba在多模态图像融合方面展现出巨大的潜力。基于此,我们提出UAVD-Mamba,这是一种基于Mamba架构的多模态无人机目标检测框架。为提高几何适应性,我们提出可变形Token Mamba模块 (DTMB),通过融合来自可变形卷积的自适应补丁与来自普通卷积的普通补丁,以生成可变形Token,这些Token作为Mamba模块的输入。为优化多模态特征互补性,我们为RGB和红外 (IR) 两个模态分别设计两个独立的DTMB,将两个DTMB的输出整合到Mamba模块中进行特征提取,以及整合到融合Mamba模块中进行特征融合。此外,为提高多尺度目标检测(尤其是小目标检测),我们在不同尺度上堆叠四个DTMB,以产生多尺度特征表示,然后送入检测颈部 (DNM) 进行Mamba处理。DNM模块受YOLO系列的启发,包括对YOLOv11的SPPF和C3K2的修改,以更好地处理多尺度特征。特别是,我们在DTMB之前采用交叉增强的空间注意力,在Fusion Mamba模块之后采用交叉通道注意力,以提取更具辨识力的特征。在DroneVehicle数据集上的实验结果表明,我们的方法在mAP指标上超过基线OAFA方法提高了3.6%。代码将在https://github.com/GreatPlum-hnu/UAVD-Mamba.git发布。

关键词

引用

@article{arxiv.2507.00849,
  title  = {UAVD-Mamba: Deformable Token Fusion Vision Mamba for Multimodal UAV Detection},
  author = {Wei Li and Jiaman Tang and Yang Li and Beihao Xia and Ligang Tan and Hongmao Qin},
  journal= {arXiv preprint arXiv:2507.00849},
  year   = {2025}
}

备注

The paper was accepted by the 36th IEEE Intelligent Vehicles Symposium (IEEE IV 2025)