中文

基于SAM引导的扩散模型用于高保真红外和可见图像融合

计算机视觉与模式识别 2026-03-24 v6 人工智能

摘要

红外和可见图像融合(IVIF)对于整合热力学显著性和纹理细节以支持下游感知至关重要。然而,大多数现有方法 suffer 于“语义盲区”,导致热目标被错误抑制并引入视觉伪影。为解决此问题,我们提出了基于Segment Anything Model(SAM)的扩散融合网络(SGDFuse),一种新的语义引导生成(SGG)框架,将IVIF重新定义为语义驱动的生成任务,而非简单的像素映射。我们的方法独特地将来自Segment Anything Model(SAM)的高层语义先验与条件扩散模型的高保真生成能力相耦合。我们采用刻意的两阶段策略,将多模态对齐与迭代细化解耦:阶段I通过初步融合建立稳健的结构基础,而阶段II利用双模态语义掩码作为空间锚点,引导扩散过程实现语义一致的高保真重构。全面实验表明,SGDFuse不仅提供领先的图像质量,还增强了下游任务性能,证明其作为一种新的方法论框架用于语义感知图像融合的有效性。该代码可在 https://github.com/boshizhang123/SGDFuse 获取。

关键词

引用

@article{arxiv.2508.05264,
  title  = {SGDFuse: SAM-Guided Diffusion Model for High-Fidelity Infrared and Visible Image Fusion},
  author = {Xiaoyang Zhang and jinjiang Li and Guodong Fan and Yakun Ju and Linwei Fan and Jun Liu and Alex C. Kot},
  journal= {arXiv preprint arXiv:2508.05264},
  year   = {2026}
}

备注

Published in Information Fusion