潜在扩散模型的像素空间后训练
计算机视觉与模式识别
2024-09-27 v1 人工智能
机器学习
摘要
潜在扩散模型(Latent Diffusion Models, LDMs)近年来在图像生成领域取得了显著进展。LDMs 的一个主要优势是能够在压缩的潜在空间中运行,从而实现更高效的训练和部署。然而,尽管拥有这些优势,LDMs 仍面临挑战。例如,人们注意到 LDMs 常常在生成高频细节和复杂构图方面存在不完美之处。我们假设,这些缺陷的一个原因是由于所有预训练和后训练都在潜在空间中完成,而该空间通常比输出图像低出 的空间分辨率。为解决此问题,我们提出在后训练过程中添加像素空间监督,以更好地保留高频细节。实验结果表明,添加像素空间目标在视觉质量和视觉缺陷指标上均显著优于仅使用潜在空间监督的后训练,在最先进的 DiT Transformer 和 U-Net 扩散模型上均表现出明显提升,但保持了相同的文本对齐质量。
引用
@article{arxiv.2409.17565,
title = {Pixel-Space Post-Training of Latent Diffusion Models},
author = {Christina Zhang and Simran Motwani and Matthew Yu and Ji Hou and Felix Juefei-Xu and Sam Tsai and Peter Vajda and Zijian He and Jialiang Wang},
journal= {arXiv preprint arXiv:2409.17565},
year = {2024}
}