中文

FS-Diff:语义引导与清晰度感知的联合多模态图像融合与超分辨率

星系天体物理 2025-11-26 v1

摘要

图像融合与低层视觉技术之一,图像融合将来自源图像的互补信息整合以生成信息丰富的融合图像。近年来已有少量研究尝试同时实现图像融合与超分辨率。然而,在实际应用中,如军事侦察和远距离探测任务中,多模态图像中的目标和背景结构容易受到损坏,分辨率低且语义信息不足,这导致当前融合技术获得亚optimal结果。为此,我们提出FS-Diff,一种语义引导和清晰度感知的联合图像融合与超分辨方法。FS-Diff 将图像融合和超分辨率统一为条件生成问题。它利用来自清晰度感知机制的语义引导,以实现自适应低分辨率感知和跨模态特征提取。具体而言,我们将所需融合结果初始化为纯高斯噪声,并引入双向特征 Mamba 从多模态图像中提取全局特征。此外,利用源图像和语义作为条件,通过修改 U-Net 网络实现随机迭代去噪过程。该网络在多个噪声水平下进行去噪训练,以产生具有跨模态特征和丰富语义信息的高分辨率融合结果。我们还构建了一个强大的空中视角多场景 (AVMS) 基准,包含 600 对图像。对六个公开数据集和我们的 AVMS 数据集上的大量联合图像融合与超分辨实验表明,FS-Diff 在多个放大倍率下优于最先进的方法,能够在融合图像中恢复更丰富的细节和语义信息。代码已公开于 https://github.com/XylonXu01/FS-Diff。

关键词

引用

@article{arxiv.2509.09426,
  title  = {Gas-rich dwarf galaxy multiples in the Apertif HI survey},
  author = {B. Šiljeg and E. A. K. Adams and F. Fraternali and K. M. Hess and A. Marasco and H. Dénes and J. Garrido and D. M. Lucero and R. Morganti and S. Sánchez-Expósito and J. M. van der Hulst},
  journal= {arXiv preprint arXiv:2509.09426},
  year   = {2025}
}

备注

13 pages, 10 figures, accepted for publication in Astronomy and Astrophysics