SeeSR:面向语义感知的真实世界图像超分辨率
计算机视觉与模式识别
2024-06-05 v2
摘要
得益于强大的生成先验,预训练的文本到图像(T2I)扩散模型在解决真实世界图像超分辨率问题中日益流行。然而,由于输入低分辨率(LR)图像存在严重的质量退化,局部结构的破坏会导致图像语义模糊。因此,所生成高分辨率图像的内容可能出现语义错误,从而降低超分辨率性能。为解决此问题,我们提出一种语义感知方法,以更好地保持生成式真实世界图像超分辨率的语义保真度。首先,我们训练了一个退化感知提示提取器,即便在强退化下也能生成准确的软语义提示与硬语义提示。硬语义提示指图像标签,旨在增强 T2I 模型的局部感知能力,而软语义提示则对硬提示进行补充以提供额外的表征信息。这些语义提示促使 T2I 模型生成细节丰富且语义准确的结果。此外,在推理过程中,我们将 LR 图像整合到初始采样噪声中,以缓解扩散模型生成过多随机细节的倾向。实验表明,我们的方法能重现更真实的图像细节并更好地保持语义。我们的方法源代码见 https://github.com/cswry/SeeSR。
引用
@article{arxiv.2311.16518,
title = {SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution},
author = {Rongyuan Wu and Tao Yang and Lingchen Sun and Zhengqiang Zhang and Shuai Li and Lei Zhang},
journal= {arXiv preprint arXiv:2311.16518},
year = {2024}
}
备注
Accepted by CVPR2024