MegaSR:挖掘定制化语义与表达性指导以实现真实世界图像超分辨率
计算机视觉与模式识别
2025-12-03 v2
摘要
文本到图像(T2I)模型因其用于多模态学习的丰富内部隐式知识,为真实世界图像超分辨率(Real-ISR)开启了新时代。尽管引入高级语义先验和密集像素指导推动了重建技术的进步,但我们通过分析现有基于T2I的Real-ISR方法的行为,发现了几个关键现象:(1)精细细节缺失,最终导致局部区域重建不正确;(2)块级语义不一致,导致U-Net各模块间的语义解释分散;(3)边缘模糊,引起明显的结构退化。基于这些观察,我们首先提出了MegaSR,通过细粒度定制化语义和表达性指导增强基于T2I的Real-ISR模型,以解锁语义丰富且结构一致的重建。然后,我们提出了定制化语义模块(CSM),以从图像模态中补充细粒度语义,并调节多级知识间的语义融合,从而实现不同U-Net模块的定制化。除了语义自适应外,我们通过成对比较识别出表达性多模态信号,并引入多模态信号融合模块(MSFM)对其进行聚合,以实现结构一致的重建。在真实世界和合成数据集上的大量实验证明了该方法的优越性。值得注意的是,它不仅在质量驱动的指标上取得了SOTA性能,而且在保真度导向的指标上保持竞争力,在感知真实性与忠实内容重建之间取得了平衡。
引用
@article{arxiv.2503.08096,
title = {MegaSR: Mining Customized Semantics and Expressive Guidance for Real-World Image Super-Resolution},
author = {Xinrui Li and Jinrong Zhang and Jianlong Wu and Chong Chen and Liqiang Nie and Zhouchen Lin},
journal= {arXiv preprint arXiv:2503.08096},
year = {2025}
}