中文

DOD-SA:基于单模态标注的红外-可见光解耦目标检测

计算机视觉与模式识别 2025-08-15 v1

摘要

红外-可见光目标检测通过利用红外和可见光图像的互补信息实现鲁棒的全天候感知,在实际应用中显示出巨大潜力。然而,现有方法通常需要双模态标注才能在预测时输出两种模态的检测结果,这带来了高昂的标注成本。为应对这一挑战,我们提出了一种新颖的基于单模态标注的红外-可见光解耦目标检测框架,称为 DOD-SA。DOD-SA 的架构建立在单-双模态协同师生网络(CoSD-TSNet)之上,该网络由一个单模态分支(SM-Branch)和一个双模态解耦分支(DMD-Branch)组成。教师模型为未标注模态生成伪标签,同时支持学生模型的训练。这种协同设计实现了从已标注模态到未标注模态的跨模态知识迁移,并促进了有效的 SM 到 DMD 分支监督。为了进一步提高模型的解耦能力和伪标签质量,我们引入了一种渐进式自调节训练策略(PaST),分三个阶段训练模型:(1) 预训练 SM-Branch,(2) 通过 SM-Branch 引导 DMD-Branch 的学习,以及 (3) 精炼 DMD-Branch。此外,我们设计了一个伪标签分配器(PLA)来对齐和配对跨模态的标签,显式地处理训练过程中的模态不对齐问题。在 DroneVehicle 数据集上的大量实验表明,我们的方法优于最先进技术(SOTA)。

关键词

引用

@article{arxiv.2508.10445,
  title  = {DOD-SA: Infrared-Visible Decoupled Object Detection with Single-Modality Annotations},
  author = {Hang Jin and Chenqiang Gao and Junjie Guo and Fangcen Liu and Kanghui Tian and Qinyao Chang},
  journal= {arXiv preprint arXiv:2508.10445},
  year   = {2025}
}

备注

9 pages, 5 figures