中文

MiPa: 混合补丁的红外-可见光模态无关目标检测

计算机视觉与模式识别 2024-08-05 v2

摘要

在现实场景中,使用可见光(RGB)和红外(IR)等多种模态可以极大地提高目标检测等预测任务的性能。多模态学习是利用这些模态的常见方式,其中使用多个特定模态的编码器和一个融合模块来提高性能。在本文中,我们采用了一种不同的方式来利用RGB和IR模态,其中只有一个共享的视觉编码器观察到其中一种模态。这种现实设置需要更小的内存占用,更适合自动驾驶和监控等通常依赖RGB和IR数据的应用。然而,在多个模态上训练单个编码器时,一种模态可能主导另一种模态,产生不均匀的识别结果。本文研究如何有效利用RGB和IR模态训练一个通用的基于Transformer的目标检测视觉编码器,同时对抗模态不平衡的影响。为此,我们引入了一种新颖的训练技术,从两种模态中混合补丁(MiPa),并结合一个逐补丁的模态无关模块,以学习两种模态的公共表示。我们的实验表明,MiPa可以学习一种表示,在传统的RGB/IR基准测试上达到有竞争力的结果,同时推理时仅需单一模态。我们的代码可在https://github.com/heitorrapela/MiPa获取。

关键词

引用

@article{arxiv.2404.18849,
  title  = {MiPa: Mixed Patch Infrared-Visible Modality Agnostic Object Detection},
  author = {Heitor R. Medeiros and David Latortue and Eric Granger and Marco Pedersoli},
  journal= {arXiv preprint arXiv:2404.18849},
  year   = {2024}
}