中文

L2P:像素生成中潜在潜能的解锁

计算机视觉与模式识别 2026-05-13 v1 人工智能

摘要

像素扩散模型最近重新受到关注。然而,从头训练高级像素空间模型需要巨大的计算和数据资源。为此,我们提出了潜在到像素(Latent-to-Pixel,L2P)转移范式,这是一个高效框架,直接利用预训练扩散生成模型(LDM)的丰富知识,以构建强大的像素空间模型。具体而言,L2P 舍弃 VAE,取而代之以大块分块标记化,并冻结源 LDM 的中间层,仅训练浅层层来学习潜在到像素的转换。通过利用 LDM 生成的合成图像作为唯一的训练语料,L2P 能在已平滑的数据流形上快速收敛,且无需收集真实数据。该策略使 L2P 能够仅用 8 块 GPU 即可将大量潜在先验无缝迁移到像素空间,同时消除 VAE 内存瓶颈,实现原生 4K 超高分辨率生成。广泛实验表明,L2P 在训练开销几乎可忽略不计,但在 DPG-Bench 上表现与源 LDM 相当,在 GenEval 上达到 93% 的性能。

关键词

引用

@article{arxiv.2605.12013,
  title  = {L2P: Unlocking Latent Potential for Pixel Generation},
  author = {Zhennan Chen and Junwei Zhu and Xu Chen and Jiangning Zhang and Jiawei Chen and Zhuoqi Zeng and Wei Zhang and Chengjie Wang and Jian Yang and Ying Tai},
  journal= {arXiv preprint arXiv:2605.12013},
  year   = {2026}
}

备注

project page: https://nju-pcalab.github.io/projects/L2P/