中文

用于RGB-T显著性检测的多模态混合学习与顺序训练

计算机视觉与模式识别 2023-09-15 v1

摘要

RGB-T显著性检测已成为一项重要的计算机视觉任务,用于在暗环境等挑战性场景中识别显著物体。然而,现有方法忽视了跨模态特征的特性,仅依赖网络结构来融合RGB与热红外特征。为此,我们首先提出一种多模态混合损失(Multi-Modal Hybrid loss, MMHL),其由监督与自监督损失函数组成。MMHL的监督损失部分明确利用来自不同模态的语义特征,而自监督损失部分缩小RGB与热红外特征间的距离。我们进一步在特征融合时同时考虑空间与通道信息,并提出混合融合模块以有效融合RGB与热红外特征。最后,我们没有采用跨模态特征联合训练网络,而是实施了一种顺序训练策略:第一阶段仅在RGB图像上训练,第二阶段再学习跨模态特征。该训练策略在不增加计算开销的情况下提升了显著性检测性能。性能评估与消融实验结果表明,所提方法相比现有最先进(SOTA)方法取得了更优性能。

关键词

引用

@article{arxiv.2309.07297,
  title  = {Multi-Modal Hybrid Learning and Sequential Training for RGB-T Saliency Detection},
  author = {Guangyu Ren and Jitesh Joshi and Youngjun Cho},
  journal= {arXiv preprint arXiv:2309.07297},
  year   = {2023}
}

备注

8 Pages main text, 3 pages supplementary information, 12 figures