GenDR:轻量级生成式细节恢复
计算机视觉与模式识别
2026-02-12 v3 人工智能
图像与视频处理
摘要
尽管近期将文本到图像 (T2I) 扩散模型应用于真实世界超分辨率 (SR) 的研究取得了显著进展,但其目标的不一致性导致推理速度与细节保真度之间存在次优的权衡。具体而言,T2I 任务需要多个推理步骤来合成与提示匹配的图像,并降低潜在维度以降低生成难度。相反,SR 可以在较少的推理步骤中恢复高频细节,但它需要更可靠的自编码器 (VAE) 来保留输入信息。然而,大多数基于扩散的 SR 是多步的并使用 4 通道 VAE,而具有 16 通道 VAE 的现有模型是能力过剩的扩散 Transformer,例如 FLUX (12B)。为了对齐目标,我们提出了一个用于生成式细节恢复的单步扩散模型 GenDR,该模型从具有更大潜在空间的定制扩散模型中蒸馏而来。具体来说,我们通过表示对齐训练了一个新的 SD2.1-VAE16 (0.9B),在不增加模型大小的情况下扩展了潜在空间。关于步骤蒸馏,我们提出了一致性分数身份蒸馏 (CiD),它将 SR 任务特定的损失纳入分数蒸馏中,以利用更多的 SR 先验并对齐训练目标。此外,我们用对抗学习和表示对齐 (CiDA) 扩展了 CiD,以增强感知质量并加速训练。我们还优化了流程以实现更高效的推理。实验结果表明,GenDR 在定量指标和视觉保真度方面都达到了 SOTA 性能。
引用
@article{arxiv.2503.06790,
title = {GenDR: Lighten Generative Detail Restoration},
author = {Yan Wang and Shijie Zhao and Kexin Zhang and Junlin Li and Li Zhang},
journal= {arXiv preprint arXiv:2503.06790},
year = {2026}
}
备注
Accepted by ICLR 2026