中文

提高扩散模型在图像超分辨率中的一致性

计算机视觉与模式识别 2025-04-28 v2

摘要

最近的方法利用强大的文本到图像(T2I)扩散模型实现了对现实图像超分辨率(Real-ISR)的卓越成绩。然而,我们注意到扩散方法中存在两种不一致性,阻碍现有模型充分发挥扩散先验的潜力。第一种是由于扩散引导导致的语义不一致。T2I生成侧重于与文本提示在语义层面保持一致,而Real-ISR强调从低质量(LQ)图像进行像素级重建,使得从LQ输入获取更详细的语义引导变得必要。第二种是训练-推理不一致,源于DDPM,它错误地将被高斯噪声污染的高质量(HQ)潜在表示作为每个时间步的去噪输入。为解决这些问题,我们引入ConsisSR来处理语义和训练-推理两方面的一致性。一方面,为了解决语义不一致,我们提出了混合提示适配器(HPA)。我们不使用带有粗糙分类信息的文本提示,而是利用更强大的CLIP图像嵌入来探索额外的颜色和纹理引导。另一方面,我们引入Time-Aware Latent Augmentation(TALA)来弥合训练-推理不一致。基于概率函数p(t),我们相应地增强了SDSR训练策略。使用带有高斯噪声的LQ潜在表示作为输入,TALA不仅关注扩散噪声,还将LQ潜在表示引导 toward HQ版本。我们的方法在现有扩散模型中实现了最先进的性能。代码将公开发布。

关键词

引用

@article{arxiv.2410.13807,
  title  = {Improving Consistency in Diffusion Models for Image Super-Resolution},
  author = {Junhao Gu and Peng-Tao Jiang and Hao Zhang and Mi Zhou and Jinwei Chen and Wenming Yang and Bo Li},
  journal= {arXiv preprint arXiv:2410.13807},
  year   = {2025}
}