中文

JLT:潜在扩散Transformer中的干净潜在预测

计算机视觉与模式识别 2026-05-28 v2 机器学习

摘要

流匹配技术通过干净数据预测表明,对干净点的回归比预测环境噪声量更能有效地利用低维结构。我们询问,这一原则在图像映射到学习潜在空间后是否仍然有用,后者已通过压缩移除了大量原始像素变异性。我们引入JLT,一个1.3亿参数的潜在扩散Transformer,基于冻结的 FLUX.2 VAE 编码器进行训练,并将干净潜在预测与匹配速度预测的DiT进行比较。尽管三个变量 x、epsilon 和 v 在固定腐蚀时间下可线性转换,但局部高斯分析表明,速度回归继承了各向同性目标协方差底线并放大低方差潜在方向,而干净预测则抑制了这些方向。在 ImageNet 256x256 上,JLT-B/1 在无条件指导下获得 FID-50K 2.50,与速度预测之间存在较大的匹配目标差距。这表明潜在扩散中的预测目标是表示依赖的几何选择,而非可互换的代数参数化。

关键词

引用

@article{arxiv.2605.27102,
  title  = {JLT: Clean-Latent Prediction in Latent Diffusion Transformers},
  author = {Funing Fu and Tenghui Wang and Guanyu Zhou and Junyong Cen and Qichao Zhu},
  journal= {arXiv preprint arXiv:2605.27102},
  year   = {2026}
}