中文

扩散模型友好潜在流形的关键因素:基于先验对齐的自编码器用于潜在扩散

计算机视觉与模式识别 2026-05-11 v1

摘要

标记器是潜在扩散模型的关键组成部分,因为它们定义了扩散模型所操作的潜在空间。然而,现有标记器主要旨在提高重构保真度或继承预训练表示,导致潜在空间是否真正适合生成建模尚不明确。本文从潜在流形组织方式的角度研究此问题。通过构建受控的标记器变体,我们识别出三项扩散友好潜在流形的关键属性:一致的空间结构、局部流形连续性以及全局流形语义。我们发现,这些属性与下游生成质量的一致性更高,而非重构保真度。鼓励此发现,我们提出先验对齐自编码器 (Prior-Aligned AutoEncoder, PAE),其显式塑造潜在流形,而非让扩散友好流形间接地从重构或继承中浮现。具体而言,PAE 利用来自 VFMs 的精炼先验以及基于扰动的正则化,将空间结构、局部连续性和全局语义转化为显式训练目标。在 ImageNet 256x256 上,PAE 在训练效率和生成质量方面均优于现有标记器,在相同训练设置下,收敛速度快至 RAE 的 13 倍,实现了新的最佳 gFID 分数 1.03。这些结果凸显了组织潜在流形对潜在扩散模型的重要性。

关键词

引用

@article{arxiv.2605.07915,
  title  = {What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion},
  author = {Zhengrong Yue and Taihang Hu and Mengting Chen and Haiyu Zhang and Zihao Pan and Tao Liu and Zikang Wang and Jinsong Lan and Xiaoyong Zhu and Bo Zheng and Yali Wang},
  journal= {arXiv preprint arXiv:2605.07915},
  year   = {2026}
}