SeaDATE:通过对比学习实现语义对齐的双注意力Transformer用于多模态目标检测
计算机视觉与模式识别
2024-10-16 v1
摘要
多模态目标检测利用多样化的模态信息来提升检测器的准确性和鲁棒性。通过学习长期依赖关系,Transformer能够有效地在特征提取阶段集成多模态特征,显著提高了多模态目标检测的性能。然而,当前方法仅堆叠Transformer引导的融合技术,未探索其在网络不同深度层提取特征的潜力,从而限制了检测性能的提升。在本文中,我们提出了一种精准且高效的对象检测方法,称为SeaDATE。初始,我们提出一种新颖的双注意力特征融合(DTF)模块,该模块在Transformer的指导下,通过双注意力机制整合局部和全局信息,通过空间和通道token从正交角度加强多模态特征的融合。同时,我们的理论分析和实证验证表明,Transformer引导的融合方法(将图像视为像素序列进行融合)在处理浅层特征的细节信息方面优于处理深层语义信息。为此,我们设计了一个对比学习(CL)模块,旨在学习多模态样本的特征,弥补Transformer引导的融合在提取深层语义特征方面的不足,并有效利用跨模态信息。在FLIR、LLVIP和M3FD数据集上的大量实验和消融研究表明,我们的方法有效,实现了最先进的检测性能。
关键词
引用
@article{arxiv.2410.11358,
title = {SeaDATE: Remedy Dual-Attention Transformer with Semantic Alignment via Contrast Learning for Multimodal Object Detection},
author = {Shuhan Dong and Yunsong Li and Weiying Xie and Jiaqing Zhang and Jiayuan Tian and Danian Yang and Jie Lei},
journal= {arXiv preprint arXiv:2410.11358},
year = {2024}
}