重温扩散自编码器训练:提升图像重构质量
计算机视觉与模式识别
2025-05-01 v1 人工智能
摘要
扩散自编码器(DAEs)通常被建模为噪声预测模型,并使用线性 噪声计划进行训练,该计划在高噪声水平阶段耗尽了大量采样步骤。由于高噪声水平与恢复大尺度图像结构相关,而低噪声水平则与恢复细节相关,这种配置可能导致低质量和模糊的图像。然而,由于潜在码本就包含结构信息,应该可以在花费更少的步骤恢复结构的情况下提高细节质量。基于这一洞察,我们提出了一种新的 DAE 训练方法,以提高重构图像的质量。我们将训练分为两个阶段。在第一个阶段,DAE 被训练为一个普通的自编码器,通过始终将噪声水平设置为最高值,迫使编码器和解码器填充潜在码以包含结构信息。在第二个阶段,我们引入噪声计划,在低噪声区域耗费更多时间,使 DAE 学习如何完善细节。我们的方法生成的图像在保持潜在码有用属性的同时,拥有准确的高层次结构和低层次细节。
引用
@article{arxiv.2504.21368,
title = {Revisiting Diffusion Autoencoder Training for Image Reconstruction Quality},
author = {Pramook Khungurn and Sukit Seripanitkarn and Phonphrm Thawatdamrongkit and Supasorn Suwajanakorn},
journal= {arXiv preprint arXiv:2504.21368},
year = {2025}
}
备注
AI for Content Creation (AI4CC) Workshop at CVPR 2025