中文

带掩码自编码器的潜在扩散模型

计算机视觉与模式识别 2025-10-23 v3

摘要

尽管潜在扩散模型(Latent Diffusion Models, LDMs)在图像生成方面展现出巨大潜力,但其自编码器的理想属性与最优设计仍未得到充分探讨。本文分析了自编码器在LDMs中的作用,识别出三个关键属性:潜在平滑性、感知压缩质量与重构质量。我们表明现有自编码器无法同时满足这三项要求,提出变分掩码自编码器(Variational Masked AutoEncoders, VMAEs),利用掩码自编码器保留的层次化特征优势。将VMAEs集成至LDM框架,形成带掩码自编码器的潜在扩散模型(Latent Diffusion Models with Masked AutoEncoders, LDMAEs)。代码已公开:https://github.com/isno0907/ldmae。

关键词

引用

@article{arxiv.2507.09984,
  title  = {Latent Diffusion Models with Masked AutoEncoders},
  author = {Junho Lee and Jeongwoo Shin and Hyungwook Choi and Joonseok Lee},
  journal= {arXiv preprint arXiv:2507.09984},
  year   = {2025}
}