中文

掩码自注意力编码器是扩散模型有效的标记化器

计算机视觉与模式识别 2025-06-02 v2 人工智能 机器学习

摘要

最近的潜在扩散模型进展表明其对高分辨率图像合成效果显著。然而,扩散模型所依赖的标记器的潜在空间特性尚未得到充分探索。从理论和实证角度看,我们发现改进的生成质量与潜在分布具有更好结构(例如模式更少的高斯混合分布和更具辨识特征的分布)密切相关。基于这些洞见,我们提出 MAETok,一种自注意力编码器(AE),通过掩码建模学习语义丰富的潜在空间,同时保持重构保真度。广泛的实验验证了我们的分析,表明自注意力编码器的变分形式并非必要,仅凭 AE 所获得的判别性潜在空间即可在仅使用 128 个标记的情况下实现 ImageNet 生成的领先性能。MAETok 实现了显著的实际改进,使 512x512 生成的 gFID 达到 1.69,训练速度提升 76 倍,推理吞吐量提升 31 倍。我们的发现表明,潜在空间的结构而非变分约束是有效扩散模型的关键。

关键词

引用

@article{arxiv.2502.03444,
  title  = {Masked Autoencoders Are Effective Tokenizers for Diffusion Models},
  author = {Hao Chen and Yujin Han and Fangyi Chen and Xiang Li and Yidong Wang and Jindong Wang and Ze Wang and Zicheng Liu and Difan Zou and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2502.03444},
  year   = {2025}
}