中文

基于l0正则化稀疏编码的可解释网络用于多模态图像融合

计算机视觉与模式识别 2025-12-12 v2

摘要

多模态图像融合(MMIF)通过结合来自不同模态传感器图像的独特特征和共同特征来增强融合图像的信息内容,改善可视化、目标检测和许多其他任务。在本工作中,我们提出了一种名为FNet的可解释网络,用于MMIF任务,其基于l0正则化多模态卷积稀疏编码(MCSC)模型。具体而言,为了求解l0正则化CSC问题,我们通过深度展开以原则性的方式设计了一个可学习的l0正则化稀疏编码(LZSC)模块。给定不同模态的源图像,FNet首先使用LZSC模块分离独特特征和共同特征,然后将这些特征组合以生成最终的融合图像。此外,我们为逆融合过程提出了l0正则化MCSC模型。基于该模型,我们引入了一个可解释逆融合网络IFNet,用于FNet的训练。大量实验表明,FNet在八个不同MMIF数据集上取得了高质量的融合结果。此外,我们证明FNet增强了可见光-红外图像对中的下游目标检测和语义分割。我们还可视化了FNet的中间结果,展示了我们网络的良好可解释性。代码和模型链接:https://github.com/gargi884/FNet-MMIF。

关键词

引用

@article{arxiv.2411.04519,
  title  = {l0-Regularized Sparse Coding-based Interpretable Network for Multi-Modal Image Fusion},
  author = {Gargi Panda and Soumitra Kundu and Saumik Bhattacharya and Aurobinda Routray},
  journal= {arXiv preprint arXiv:2411.04519},
  year   = {2025}
}

备注

Accetped by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)