中文

面向目标感知的红外-可见图像融合

计算机视觉与模式识别 2025-09-16 v1 机器学习

摘要

红外和可见图像融合(IVIF)是多模态感知中的基础任务,旨在整合来自不同光谱域中互补的结构和纹理线索。本文提出FusionNet,一种新颖的端到端融合框架,显式建模跨模态相互作用并增强任务关键区域。FusionNet引入一种模态感知注意力机制,动态调整红外和可见特征贡献,基于其判别能力。为实现细粒度、可解释的融合,我们进一步采用像素级alpha混合模块,学习空间变化的融合权重,以适应内容而异。此外,我们构建目标感知损失,利用弱ROI监督保留包含重要物体(如行人、车辆)等区域的语义一致性。在公开M3FD数据集上的实验表明,FusionNet生成的融合图像在语义保持性、感知质量和清晰可解释性方面均表现出优势。我们的框架为语义感知的多模态图像融合提供了通用且可扩展的解决方案,对于目标检测和场景理解等下游任务具有积极影响。

关键词

引用

@article{arxiv.2509.11476,
  title  = {Modality-Aware Infrared and Visible Image Fusion with Target-Aware Supervision},
  author = {Tianyao Sun and Dawei Xiang and Tianqi Ding and Xiang Fang and Yijiashun Qi and Zunduo Zhao},
  journal= {arXiv preprint arXiv:2509.11476},
  year   = {2025}
}

备注

Accepted by 2025 6th International Conference on Computer Vision and Data Mining (ICCVDM 2025)