MiPa: 混合补丁的红外-可见光模态无关目标检测
计算机视觉与模式识别
2024-08-05 v2
摘要
在现实场景中,使用可见光(RGB)和红外(IR)等多种模态可以极大地提高目标检测等预测任务的性能。多模态学习是利用这些模态的常见方式,其中使用多个特定模态的编码器和一个融合模块来提高性能。在本文中,我们采用了一种不同的方式来利用RGB和IR模态,其中只有一个共享的视觉编码器观察到其中一种模态。这种现实设置需要更小的内存占用,更适合自动驾驶和监控等通常依赖RGB和IR数据的应用。然而,在多个模态上训练单个编码器时,一种模态可能主导另一种模态,产生不均匀的识别结果。本文研究如何有效利用RGB和IR模态训练一个通用的基于Transformer的目标检测视觉编码器,同时对抗模态不平衡的影响。为此,我们引入了一种新颖的训练技术,从两种模态中混合补丁(MiPa),并结合一个逐补丁的模态无关模块,以学习两种模态的公共表示。我们的实验表明,MiPa可以学习一种表示,在传统的RGB/IR基准测试上达到有竞争力的结果,同时推理时仅需单一模态。我们的代码可在https://github.com/heitorrapela/MiPa获取。
引用
@article{arxiv.2404.18849,
title = {MiPa: Mixed Patch Infrared-Visible Modality Agnostic Object Detection},
author = {Heitor R. Medeiros and David Latortue and Eric Granger and Marco Pedersoli},
journal= {arXiv preprint arXiv:2404.18849},
year = {2024}
}