带掩码自编码器的潜在扩散模型
计算机视觉与模式识别
2025-10-23 v3
摘要
尽管潜在扩散模型(Latent Diffusion Models, LDMs)在图像生成方面展现出巨大潜力,但其自编码器的理想属性与最优设计仍未得到充分探讨。本文分析了自编码器在LDMs中的作用,识别出三个关键属性:潜在平滑性、感知压缩质量与重构质量。我们表明现有自编码器无法同时满足这三项要求,提出变分掩码自编码器(Variational Masked AutoEncoders, VMAEs),利用掩码自编码器保留的层次化特征优势。将VMAEs集成至LDM框架,形成带掩码自编码器的潜在扩散模型(Latent Diffusion Models with Masked AutoEncoders, LDMAEs)。代码已公开:https://github.com/isno0907/ldmae。
引用
@article{arxiv.2507.09984,
title = {Latent Diffusion Models with Masked AutoEncoders},
author = {Junho Lee and Jeongwoo Shin and Hyungwook Choi and Joonseok Lee},
journal= {arXiv preprint arXiv:2507.09984},
year = {2025}
}