少不了:基于缺失红外图像的字典引导的跨模态图像融合
计算机视觉与模式识别
2026-04-02 v2
摘要
红外-可见(IR-VIS)图像融合对于感知和安防至关重要,但大多数方法在训练和推理时都依赖于双模态数据的可用性。当红外模态缺失时,像素空间的生成性替代方案难以控制且本质上缺乏可解释性。我们通过提出一种基于共享卷积字典的系数域框架来解决缺失红外融合问题。该框架包含三个关键组件:(1)联合共享字典表示学习(JSRL)学习由IR和VIS两种模态共享的统一且可解释的原子空间;(2)VIS引导的IR推断(VGII)将VIS系数传递到伪红外系数中,并通过冻结的大型语言模型作为弱语义先验进行单步闭环细化;(3)基于表示推断的自适应融合(AFRI)通过窗口注意力和卷积混合在原子级别融合VIS结构和推断的红外线索,然后通过共享字典进行重建。该编码-传递-融合-重建管道避免了不受控制的像素空间生成,同时确保在可解释字典-系数表示中的先验保留。在缺失红外设置下的实验表明,感知质量和下游检测性能均得到一致提升。据我们所知,这是首个在 jointly 学习共享字典并进行系数域推断-融合以解决缺失红外融合的框架。源代码已公开于 https://github.com/harukiv/DCMIF。
引用
@article{arxiv.2603.08018,
title = {Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared},
author = {Yafei Zhang and Meng Ma and Huafeng Li and Yu Liu},
journal= {arXiv preprint arXiv:2603.08018},
year = {2026}
}
备注
This paper has been accepted by CVPR 2026