中文

混合融合:用于零样本跨域图像融合的一分钟高效训练

计算机视觉与模式识别 2026-02-25 v1

摘要

图像融合旨在将来自多个来源的互补信息整合到单一优越图像中。虽然传统方法速度快,但缺乏适应性和性能;相比,深度学习方法实现了最先进(SOTA)结果,但 suffer于关键效率问题:其依赖慢而资源密集的基于块的训练,导致与全分辨率推理之间存在显著差距。我们提出了一种新型混合框架,以解决这一权衡。该方法利用可学习的U-Net生成动态引导图,指导经典固定的拉普拉斯金字塔融合内核。通过将策略学习与像素合成解耦,我们实现了极其高效的全分辨率训练,消除了训练-推理之间的差距。因此,我们的模型在无需任何外部模型的情况下,即可在RTX 4090上约需一分钟或在消费级笔记本电脑GPU上约需两分钟内实现SOTA相当的性能,并在从红外-可见到医学影像等多种任务上 demonstrate powerful zero-shot generalization。就设计而言,融合输出仅由源信息线性构成,确保关键应用下的高忠实性。代码可在 https://github.com/Zirconium233/HybridFusion 获取。

关键词

引用

@article{arxiv.2602.20851,
  title  = {Hybrid Fusion: One-Minute Efficient Training for Zero-Shot Cross-Domain Image Fusion},
  author = {Ran Zhang and Xuanhua He and Liu Liu},
  journal= {arXiv preprint arXiv:2602.20851},
  year   = {2026}
}