XPSR:用于基于扩散的图像超分辨率的跨模态先验
计算机视觉与模式识别
2024-07-22 v2
摘要
基于扩散的方法凭借其强大的生成先验,最近在图像超分辨率(ISR)领域受到了越来越多的关注。然而,由于低分辨率(LR)图像往往经历严重的退化,ISR 模型难以感知语义和退化信息,导致恢复出的图像内容错误或包含不真实的伪影。为解决这些问题,我们提出了跨模态超分辨率先验(XPSR)框架。在 XPSR 中,为了获取精确且全面的语义条件以供扩散模型使用,我们利用了前沿的多模态大语言模型(MLLMs)。为了促进跨模态先验的更好融合,我们提出了语义融合注意力(Semantic-Fusion Attention)机制。为了蒸馏保留语义的信息而非不必要的退化,我们在 LR 图像及其高分辨率(HR)对应图像之间附加了无退化约束(Degradation-Free Constraint)。定量和定性结果表明,XPSR 能够在合成数据集和真实世界数据集中生成高保真度和高真实感的图像。代码已发布于 \url{https://github.com/qyp2000/XPSR}。
引用
@article{arxiv.2403.05049,
title = {XPSR: Cross-modal Priors for Diffusion-based Image Super-Resolution},
author = {Yunpeng Qu and Kun Yuan and Kai Zhao and Qizhi Xie and Jinhua Hao and Ming Sun and Chao Zhou},
journal= {arXiv preprint arXiv:2403.05049},
year = {2024}
}
备注
19 pages, 7 figures; including supplementary material