中文

分而治之:面向 RGB-T 显著性目标检测的混合三流网络

计算机视觉与模式识别 2024-12-03 v1 多媒体

摘要

RGB-热成像显著性目标检测旨在定位配准的可见光和热红外图像对中的突出目标。传统的编码器-解码器架构虽为跨模态特征交互设计,可能未充分考虑对来自不完善模态的噪声鲁棒性。受层次人类视觉系统的启发,我们提出 ConTriNet,一种采用分而治之策略的稳健混合三流网络。具体而言,ConTriNet 包含三个流:两个模态特定流探索来自 RGB 和热成像模态的线索,第三个模态互补流整合来自两个模态的线索。ConTriNet 具备几个显著优势:在模态共享联合编码器中嵌入一种由模态引起的特征调制器,以最小化跨模态差异并减轻不完善样本的影响。此外,分离流中的基础残差空洞空间金字塔模块扩大感受野,使其能够捕获多尺度上下文信息。Furthermore,一个模态感知动态聚合模块嵌入模态互补流中,动态地来自两个模态特定流的显著性相关线索。凭借所提出的并行三流框架,我们进一步通过流合作融合策略细化来自不同流的显著性图,生成最终预测的高质量全分辨率显著性图。为评估方法的鲁棒性和稳定性,我们收集了一个覆盖各种现实挑战情景的综合 RGB-T 显著性目标检测基准,VT-IMAG。对公开基准和我们 VT-IMAG 数据集上的大量实验表明,ConTriNet 在常见和挑战情景中均一致优于最先进的竞争者。

关键词

引用

@article{arxiv.2412.01556,
  title  = {Divide-and-Conquer: Confluent Triple-Flow Network for RGB-T Salient Object Detection},
  author = {Hao Tang and Zechao Li and Dong Zhang and Shengfeng He and Jinhui Tang},
  journal= {arXiv preprint arXiv:2412.01556},
  year   = {2024}
}

备注

Accepted by IEEE TPAMI. Project page: https://cser-tang-hao.github.io/contrinet.html