中文

基于无人机的三模态融合变换器用于目标检测

计算机视觉与模式识别 2026-04-21 v1

摘要

可靠的无人机目标检测需要对照明变化、运动模糊和场景动态具有鲁棒性,这些因素抑制了RGB线索。热红外长波红外(LWIR)传感器在低光条件下保持对比度,事件相机保留微秒级时间边缘,但将三种模态统一集成到检测器中尚未系统研究。我们提出了三模态框架,使用双流层次性视觉变换器处理RGB、热和事件数据。在选定的编码器深度处,应用模态感知门控交换(MAGE)进行传感器间通道和空间门控,以及双向令牌交换(BiTE)模块执行双向令牌级注意力,伴随深度可分离点卷积的细化,产生保持分辨率的融合图用于标准特征金字塔和两阶段检测器。我们引入了一个包含10,489帧同步预对齐RGB-热-事件流且覆盖24,223个标注车辆的无人机数据集,包含日间和夜间飞行。通过61项受控消融实验,我们评估了融合位置、机制(基准MAGE+BiTE、CSSA、GAFF)、模态子集和背bone容量。三模态融合优于所有双模态基线,融合深度影响显著,轻量级CSSA变体在最小成本下恢复大部分效益。本工作提供了首个系统性基准和模块化无人机三模态目标检测 backbone。

关键词

引用

@article{arxiv.2604.16630,
  title  = {Tri-Modal Fusion Transformers for UAV-based Object Detection},
  author = {Craig Iaboni and Pramod Abichandani},
  journal= {arXiv preprint arXiv:2604.16630},
  year   = {2026}
}

备注

10 pages, 4 figures