中文

消除 VAE 以实现快速高分辨率生成细节恢复

计算机视觉与模式识别 2026-02-12 v1

摘要

扩散模型在现实世界的超分辨率 (SR) 任务中取得了显著突破,但推理速度慢且对设备要求高。为加速推理,最近的工作如 GenDR 采用一步蒸馏将步骤数最小化至一。然而,内存边界仍限制了最大处理尺寸, necessitating 逐块处理高分辨率图像。通过剖析管道,我们发现变分自编码器 (VAE) 是延迟和内存的瓶颈。为彻底解决此问题,我们利用像素 (un)shuffle 操作消除 VAE,将基于潜空间的 GenDR 转换为基于像素空间的 GenDR-Pix。然而,x8 pixelshuffle 可能引发重复图案伪影。为缓解失真,我们提出了多阶段对抗性蒸馏,以逐步移除编码器和解码器。具体而言,我们利用前一阶段模型的生成特征指导对抗判别。此外,我们提出随机填充以增强生成特征,避免判别器崩溃。我们还引入掩码 Fourier 空间损失以惩罚幅值异常值。为提高推理性能,我们经验性地将填充-based 自集成与无分类器指导集成,以提高推理比例。实验结果表明,GenDR-Pix 在推理速度上比 GenDR 加速 2.8 倍,内存节省 60%,视觉降解几乎可忽略不计,超越其他一步扩散 SR 方法。奇迹的是,GenDR-Pix 仅需 1 秒和 6GB 即可恢复 4K 图像。

关键词

引用

@article{arxiv.2602.10630,
  title  = {Eliminating VAE for Fast and High-Resolution Generative Detail Restoration},
  author = {Yan Wang and Shijie Zhao and Junlin Li and Li Zhang},
  journal= {arXiv preprint arXiv:2602.10630},
  year   = {2026}
}

备注

Accepted by ICLR 2026