中文

面向潜在扩散模型的轻量化高效变分自编码器

机器学习 2025-01-22 v2 计算机视觉与模式识别

摘要

虽然潜在扩散模型(LDMs)在高分辨率图像生成方面取得了突破,但作为这些系统核心的自编码器设计空间仍未得到充分探索。本文提出LiteVAE,这是一种新的自编码器设计,利用2D离散小波变换提升了相对于标准变分自编码器(VAE)的可扩展性和计算效率,且不牺牲输出质量。我们探讨了训练方法和解码器架构,并提出了若干改进措施,以提高训练动力学和重构质量。我们的基础LiteVAE模型在当前LDMs中匹配VAE的质量,但编码器参数减少了六倍,实现更快的训练和更低的GPU内存要求;而我们更大的模型在所有评估指标(rFID、LPIPS、PSNR和SSIM)上均超越了相当复杂性的VAE。

关键词

引用

@article{arxiv.2405.14477,
  title  = {LiteVAE: Lightweight and Efficient Variational Autoencoders for Latent Diffusion Models},
  author = {Seyedmorteza Sadat and Jakob Buhmann and Derek Bradley and Otmar Hilliges and Romann M. Weber},
  journal= {arXiv preprint arXiv:2405.14477},
  year   = {2025}
}

备注

Published as a conference paper at NeurIPS 2024