中文

不存在 VAE:通过自监督预训练实现像素空间生成建模

广义相对论与量子宇宙学 2025-10-15 v1

摘要

像素空间生成模型往往难以训练且总体表现不如其潜在空间对手,留下了持续的性能和效率差距。本文引入一种新颖的两阶段训练框架,为像素空间扩散和一致性模型所需的差距。第一阶段,我们预训练编码器以捕获干净图像的有意义语义,同时将其与沿相同确定性采样轨迹的点对齐,这些轨迹演化自先验分布到数据分布。第二阶段,我们将编码器与随机初始化的解码器集成,并端到端地对扩散模型和一致性模型进行微调。我们的框架在 ImageNet 上实现了最新(SOTA)性能。具体而言,我们的扩散模型在 ImageNet-256 上以 FID 为 1.58,在 ImageNet-512 上以 FID 为 2.35(75 次函数评估),显著优于先前的像素空间方法和基于 VAE 的方法,在生成质量和训练效率方面均取得大幅提升。在直接比较中,我们的模型在仅使用约 30% 训练计算的情况下,显著优于 DiT。此外,我们的一致性模型在 ImageNet-256 上实现了惊人的 FID 为 8.82,显著优于其潜在空间对手。这标志着首次成功地在高分辨率图像上直接训练一致性模型,而无需依赖预训练的 VAE 或扩散模型。我们的代码可在 \href{https://github.com/AMAP-ML/EPG}{https://github.com/AMAP-ML/EPG} 获取。

关键词

引用

@article{arxiv.2510.12585,
  title  = {OCTOPUS: A Versatile, User-Friendly, and Extensible Public Code for General-Relativistic Ray-Tracing in Spherically Symmetric and Static Spacetimes},
  author = {Shiyang Hu and Shijie Tan and Dan Li and Lina Zhang and Chen Deng and Wenfu Cao},
  journal= {arXiv preprint arXiv:2510.12585},
  year   = {2025}
}

备注

49 pages, 24 figures, comments are welcome