基于跨通道注意力的多模态Transformer用于遥感图像目标检测
计算机视觉与模式识别
2024-06-19 v3
摘要
遥感图像(RSI)中的目标检测是地球观测(EO)众多应用中的一项关键任务。与自然图像中的目标检测不同,遥感图像中的目标检测面临标注数据稀缺以及仅由少数像素表示的小目标存在的挑战。多模态融合已被证实可通过融合来自RGB、红外(IR)、激光雷达(lidar)和合成孔径雷达(SAR)等多种模态的数据来提高精度。为此,由并行子网络产生的中期或后期表征融合占主导地位,其缺点是计算复杂度随模态数量阶数增加并产生额外的工程障碍。利用交叉注意力机制,我们提出了一种新颖的多模态融合策略,用于在早期阶段映射不同通道之间的关系,通过对齐不同模态来构建一致的输入。通过在早期而非中期或后期进行融合,与现有方法相比,我们的方法取得了具有竞争力甚至更优的性能。此外,我们通过将卷积层集成到非移位模块的前馈中增强了SWIN transformer。该增强通过局部注意力加强了模型合并分离窗口的能力,从而改善了小目标检测。大量实验证明了所提出的多模态融合模块及架构的有效性,展示了它们在多模态航拍图像目标检测中的适用性。
引用
@article{arxiv.2310.13876,
title = {Multimodal Transformer Using Cross-Channel attention for Object Detection in Remote Sensing Images},
author = {Bissmella Bahaduri and Zuheng Ming and Fangchen Feng and Anissa Mokraou},
journal= {arXiv preprint arXiv:2310.13876},
year = {2024}
}
备注
Accepted by ICIP2024