利用多模态大语言模型通过频率专家混合实现一体化图像复原
计算机视觉与模式识别
2026-05-14 v2
摘要
一体化图像复原旨在使用统一框架从受多种未知退化影响的输入中恢复干净图像。最近的方法通过识别退化特征来引导复原过程,展现出强大的性能。然而,其中许多方法将退化视为离散类别,这限制了它们对复合退化中出现的连续关系结构进行建模的能力。为了解决这个问题,我们提出了一种多模态大语言模型(MLLM)引导的图像复原框架,该框架利用多模态嵌入作为底层复原的引导。具体来说,通过 MLLM 引导的融合块(MGFB)将 MLLM 导出的特征注入到编码器-解码器架构中,以增强退化感知表示。此外,我们引入了一个频率专家混合(MoFE)模块,该模块利用 MLLM 引导的上下文线索自适应地组合频率专家。为了进一步改进专家路由,我们设计了一个带有关系对齐损失的 MLLM 引导路由器,该损失鼓励路由模式与退化输入的嵌入空间关系保持一致。在多个基准数据集上的大量实验表明,所提出的方法在多种复原设置下均取得了强大的性能,并在具有挑战性的 CDD11 数据集上建立了新的最先进水平,性能比先前方法高出高达 1.35 dB。
引用
@article{arxiv.2605.11444,
title = {Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts},
author = {Eunho Lee and Rei Kawakami and Youngbae Hwang},
journal= {arXiv preprint arXiv:2605.11444},
year = {2026}
}