MMAIF:面向语言引导的多任务、多退化图像融合一体化方案
计算机视觉与模式识别
2025-03-20 v1
摘要
图像融合是基础视觉任务,旨在将多个图像序列整合为单个输出,同时尽可能保留输入信息。然而,现有方法面临诸多局限:1)要求任务或数据集特定模型;2)忽略现实图像退化(如噪声),导致处理退化输入时失效;3)在像素空间中运行,注意力机制计算昂贵;4)缺乏用户交互能力。为此,本文提出一种统一的多任务、多退化、语言引导图像融合框架。该框架包含两个关键组件:1)实用的退化管线,模拟现实图像退化并生成用于引导模型的交互式提示;2)在潜在空间中运行的全一体扩散转换器(DiT),基于退化输入和生成提示进行图像融合。此外,本文对原始DiT架构进行原则性修改以更适合融合任务。基于此框架,本文开发了两种模型版本:回归基和流匹配基变体。大量定性和定量实验表明,我们的方法有效解决了上述局限,优于之前的恢复+融合和全一体化方案。代码已公开:https://github.com/294coder/MMAIF。
引用
@article{arxiv.2503.14944,
title = {MMAIF: Multi-task and Multi-degradation All-in-One for Image Fusion with Language Guidance},
author = {Zihan Cao and Yu Zhong and Ziqi Wang and Liang-Jian Deng},
journal= {arXiv preprint arXiv:2503.14944},
year = {2025}
}