EQ-VAE:用于改进生成式图像建模的等变正则化潜在空间
机器学习
2025-08-05 v3
摘要
潜在生成模型已成为高质量图像合成的领导性方法。这些模型依赖于自动编码器将图像压缩到潜在空间,然后通过生成模型学习潜在分布。我们指出,现有的自动编码器缺乏对语义保持变换(如缩放和旋转)的等变性,这导致潜在空间复杂化,阻碍生成性能。为此,我们提出了EQ-VAE,一种简单正则化方法,可在潜在空间中强制等变性,在不降低重构质量的前提下降低其复杂性。通过对预训练的自动编码器进行EQ-VAE微调,我们提升了包括DiT、SiT、REPA和MaskGIT等多个最先进生成模型的性能,在DiT-XL/2上仅需五个epoch的SD-VAE微调即可实现7倍加速。EQ-VAE兼容连续型和离散型自动编码器,为广泛的潜在生成模型提供了灵活的性能提升。项目页面和代码:https://eq-vae.github.io/。
引用
@article{arxiv.2502.09509,
title = {EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling},
author = {Theodoros Kouzelis and Ioannis Kakogeorgiou and Spyros Gidaris and Nikos Komodakis},
journal= {arXiv preprint arXiv:2502.09509},
year = {2025}
}
备注
ICML 2025