ControlFusion:一种基于语言-视觉退化提示的可控图像融合框架
计算机视觉与模式识别
2025-10-27 v3
摘要
当前图像融合方法难以处理现实场景中遇到的复合退化,缺乏适应用户特定需求的灵活性。为此,本文提出了一种可控图像融合框架,采用语言-视觉提示,称为ControlFusion,能够适应性中和复合退化。在一方面,我们开发了一种集成物理成像机制的退化成像模型,包括Retinex理论和大气散射原理,以模拟复合退化,为从数据层面处理现实复杂退化提供潜力。在另一方面,我们构思了一个提示调制恢复与融合网络,动态增强带有退化提示的特征,使 our方法能够适应不同程度的复合退化。具体而言,考虑到用户对质量感知的个体差异,我们包含一个文本编码器,将用户指定的退化类型和严重程度嵌入为退化提示。我们还设计了一个空间-频率协作视觉适配器,能够自主感知源图像中的退化,从而消除完全依赖用户指令。广泛的实验表明,ControlFusion在融合质量和退化处理方面优于SOTA方法,尤其擅长处理各种程度的现实世界和复合退化。源代码已公开于 https://github.com/Linfeng-Tang/ControlFusion。
引用
@article{arxiv.2503.23356,
title = {ControlFusion: A Controllable Image Fusion Framework with Language-Vision Degradation Prompts},
author = {Linfeng Tang and Yeda Wang and Zhanchuan Cai and Junjun Jiang and Jiayi Ma},
journal= {arXiv preprint arXiv:2503.23356},
year = {2025}
}
备注
Accepted to NeurIPS 2025. The code is available at https://github.com/Linfeng-Tang/ControlFusion