中文

统一潜在表示 (UL):如何训练你的潜在表示

机器学习 2026-02-20 v1 计算机视觉与模式识别

摘要

我们提出了统一潜在表示 (Unified Latents, UL),这是一种用于学习潜在表示的框架,其由扩散先验正则化并由扩散模型解码。通过将编码器的输出噪声链接到先验的最小噪声水平,我们获得了一个简单训练目标,为潜在比特率提供紧密的上界。在 ImageNet-512 上,我们的方法以 FID 1.4 实现了与竞争的水平,同时保持高质量的重构 (PSNR),且所需的训练 FLOPs 少于在 Stable Diffusion 潜在表示上训练的模型。在 Kinetics-600 上,我们设得了新的 SOTA FVD 为 1.3。

关键词

引用

@article{arxiv.2602.17270,
  title  = {Unified Latents (UL): How to train your latents},
  author = {Jonathan Heek and Emiel Hoogeboom and Thomas Mensink and Tim Salimans},
  journal= {arXiv preprint arXiv:2602.17270},
  year   = {2026}
}