FusionFM:基于流匹配的全能多模态图像融合
计算机视觉与模式识别
2025-11-19 v1 人工智能
摘要
当前多模态图像融合方法通常依赖于任务特定模型,导致高训练成本和有限的可扩展性。虽然生成方法提供了统一的建模视角,但常因从噪声到图像的复杂采样轨迹导致推理速度慢。为此,我们将图像融合建模为从源模态到融合图像分布的直接概率运输,利用流匹配范式提高采样效率和结构一致性。为缓解缺乏高质量融合图像进行监督的问题,我们收集来自多个最先进模型的融合结果作为先验,并采用任务感知选择函数为每个任务选择最可靠的伪标签。我们进一步引入融合细化模块,通过分而治之策略系统性地识别、分解和增强所选伪标签中的退化组件。对于多任务场景,我们集成弹性权重整合和经验回放机制,从参数稳定性和记忆保留两个角度保留跨任务性能并提升持续学习能力。我们的方法在多样化的融合任务上实现了竞争性能,同时显著提高了采样效率并保持轻量级模型设计。代码将在 https://github.com/Ist-Zhy/FusionFM 提供。
引用
@article{arxiv.2511.13794,
title = {FusionFM: All-in-One Multi-Modal Image Fusion with Flow Matching},
author = {Huayi Zhu and Xiu Shu and Youqiang Xiong and Qiao Liu and Rui Chen and Di Yuan and Xiaojun Chang and Zhenyu He},
journal= {arXiv preprint arXiv:2511.13794},
year = {2025}
}