中文

通过迁移 VAE 训练实现保留细节的真实图像超分辨

计算机视觉与模式识别 2025-07-29 v1

摘要

在真实图像超分辨(Real-ISR)领域,利用预训练的稳定扩散(stable diffusion, SD)模型已取得显著成果。然而,这类方法的一个关键问题在于,由于 SD 模型中 VAE(如 8 倍下采样)的激进分辨率降低,导致图像细节结构(如小字符和纹理)的重建效果较差。一种解决方案是采用更低的下采样率来进行扩散;然而,在保持预训练 UNet 适配其潜在特征的同时,又如何缓解计算成本的增加,成为新的挑战。为此,我们提出一种迁移 VAE 训练(Transfer VAE Training, TVT)策略,将 8 倍下采样的 VAE 转换为 4 倍下采样的 VAE,以适配预训练 UNet。具体而言,我们首先基于原始 VAE 编码器的输出特征训练一个 4 倍解码器,然后固定新训练的解码器,训练 4 倍编码器。这种 TVT 策略将新的编码器-解码器对与原始 VAE 的潜在空间对齐,同时增强图像的细节。此外,我们引入紧凑型 VAE 和计算高效 UNet,通过优化其网络结构,降低计算成本,同时捕获高分辨率的细粒度特征。实验结果表明,我们的 TVT 方法显著改善了细节结构的保留,这往往被其他基于 SD 的方法所牺牲,同时所需的 FLOPs 也少于最先进的单步扩散模型。官方代码可在 https://github.com/Joyies/TVT 查阅。

关键词

引用

@article{arxiv.2507.20291,
  title  = {Fine-structure Preserved Real-world Image Super-resolution via Transfer VAE Training},
  author = {Qiaosi Yi and Shuai Li and Rongyuan Wu and Lingchen Sun and Yuhui Wu and Lei Zhang},
  journal= {arXiv preprint arXiv:2507.20291},
  year   = {2025}
}

备注

ICCV 2025