中文

从单模态特征学习视角重新思考多模态目标检测

计算机视觉与模式识别 2025-07-29 v2

摘要

多模态目标检测(MMOD)因其对各种复杂环境的更强适应性,已在 various applications 中得到广泛应用。广泛的研究致力于 RGB-IR 目标检测,主要关注如何整合 RGB-IR 各模态的互补特征。然而,这些方法忽略了单模态学习不足的问题,这一问题源于多模态联合学习中特征提取能力的下降,导致出现一种普遍但不合理的现象——融合退化(Fusion Degradation),从而阻碍了 MMOD 模型的性能提升。为了解决这一问题,本文引入线性探针评估方法用于多模态检测器,并从单模态学习的角度重新思考多模态目标检测任务。因此,我们构建了一个新框架,称为 M2^2D-LIF,由单模态蒸馏(M2^2D)方法和局部感知融合(LIF)模块组成。M2^2D-LIF 框架在多模态联合训练期间促进了单模态的充分学习,并探索了一种轻量且高效的特征融合方式,以实现卓越的目标检测性能。在三个 MMOD 数据集上进行的大量实验表明,M2^2D-LIF 有效缓解了融合退化现象,并优于以前的 SOTA 检测器。代码已公开:https://github.com/Zhao-Tian-yi/M2D-LIF。

关键词

引用

@article{arxiv.2503.11780,
  title  = {Rethinking Multi-Modal Object Detection from the Perspective of Mono-Modality Feature Learning},
  author = {Tianyi Zhao and Boyang Liu and Yanglei Gao and Yiming Sun and Maoxun Yuan and Xingxing Wei},
  journal= {arXiv preprint arXiv:2503.11780},
  year   = {2025}
}

备注

10 pages, 6 figures