OMGSR:一种实用图像超分辨率只需单一中间时间步引导
计算机视觉与模式识别
2025-11-25 v2 人工智能
摘要
去噪扩散概率模型(DDPMs)在单步实用图像超分辨率(Real-ISR)中展现出巨大的潜力。当前的单步 Real-ISR 方法通常在 DDPM 调度器的开始或结束时间步注入低质量(LQ)图像潜在表示。近期研究开始注意到,LQ 图像潜在表示与预训练噪声潜在表示在中间时间步上更加接近。然而,这些潜在表示的定量分析仍不足。考虑到这些潜在表示可分解为信号与噪声,我们提出一种基于信噪比(SNR)的方法,预计算平均最佳中间时间步的注入。为更好地逼近预训练噪声潜在表示,我们进一步引入通过 LoRA 增强的 VAE 编码器实现的潜在表示细化(LRR)损失。我们还对 DDPM 基于生成模型的 backbone 进行 LoRA 微调,以在平均最佳中间时间步执行单步去噪。基于这些组件,我们提出 OMGSR,一个 GAN 基于的 Real-ISR 框架,采用 DDPM 基于生成模型作为生成器,采用 DINOv3-ConvNeXt 模型配合多级判别器头作为判别器。我们还提出 DINOv3-ConvNeXt DISTS(Dv3CD)损失,增强了在不同分辨率下的结构感知。,在 OMGSR 框架中,我们开发了基于 SD2.1-base 的 OMGSR-S。消融研究确认,我们的预计算策略和 LRR 损失显著改善了 baseline。比较研究表明,OMGSR-S 在多个指标上实现了最佳性能。代码已公开。
引用
@article{arxiv.2508.08227,
title = {OMGSR: You Only Need One Mid-timestep Guidance for Real-World Image Super-Resolution},
author = {Zhiqiang Wu and Zhaomang Sun and Tong Zhou and Bingtao Fu and Ji Cong and Yitong Dong and Huaqi Zhang and Xuan Tang and Mingsong Chen and Xian Wei},
journal= {arXiv preprint arXiv:2508.08227},
year = {2025}
}