中文

受表示空间约束的模态解耦式多模态目标检测学习

计算机视觉与模式识别 2025-11-20 v1

摘要

多模态目标检测因其提升的鲁棒性而在学术界和工业界受到广泛关注。尽管众多研究聚焦于改进模态融合策略,但大多数人忽视了融合退化问题,且尚无理论分析其根本原因。为填补这一空白,本文对多模态检测中的融合退化进行系统性理论调查,识别出两大关键优化缺陷:(1) 在多模态架构下,单模态分支的梯度被严重抑制,导致单模态分支的欠优化;(2) 模态质量差异导致质量较弱的模态经历更强的梯度抑制,从而引发模态学习的不平衡。为解决这些问题,本文提出一种表示空间约束学习伴随模态解耦(RSC-MD)的方法,包含两个模块。RSC 模块和 MD 模块分别用于放大被抑制的梯度,消除模态间的耦合干扰以及模态不平衡,从而实现每个模态特定主干网路的全面优化。在 FLIR、LLVIP、M3FD 和 MFAD 数据集上进行的大量实验表明,所提方法有效缓解了融合退化,在多个基准测试中实现了最先进的性能。代码与训练流程将在 https://github.com/yikangshao/RSC-MD 上发布。

关键词

引用

@article{arxiv.2511.15433,
  title  = {Representation Space Constrained Learning with Modality Decoupling for Multimodal Object Detection},
  author = {YiKang Shao and Tao Shi},
  journal= {arXiv preprint arXiv:2511.15433},
  year   = {2025}
}

备注

This work has been submitted to the IEEE for possible publication