PiD:基于像素扩散的高分辨率潜在解码
计算机视觉与模式识别
2026-05-25 v1
摘要
大多数实际可用的高分辨率文本到图像系统,包括潜在扩散和自回归模型,都在紧凑的潜在空间中进行生成,解码器将生成的潜在表示映射回像素。然而,潜在到像素的解码器是以重建为导向的,优化目标是逆转编码器,而非合成更多细节,在 megapixel 级别时变得越来越昂贵。这一缺陷迫切需要更具表达力且更高效的解码范式。受最近可扩展像素空间扩散进展的启发,我们引入 PiD,即 Pixel diffusion Decoder,将潜在解码建模为条件像素扩散,统一解码和上采样为一个生成模块。通过直接在高分辨率像素空间去噪,PiD 能够以低延迟合成 甚至 上采样后的图像。对于潜在条件,轻量级 sigma-aware 适配器将带噪声的潜在表示注入像素扩散主干网络,使 PiD 能够解码部分去噪的潜在表示,提前终止潜在扩散过程。为进一步提升效率,我们使用 DMD2 进行模型蒸馏,将推理步骤减少至仅 4 步。PiD 可用于常规 VAE 潜在表示和最新基于语义潜在表示(如 SigLIP、DINOv2)的 RAE 模型。PiD 在消费级 RTX 5090 上将 的潜在表示解码为 像素,峰值内存仅 13 GB,耗时不到 1 秒;在 GB200 GPU 上甚至可在 210 毫秒内完成,速度约为级联扩散超分辨率管道的 ,且视觉保真度更佳。
引用
@article{arxiv.2605.23902,
title = {PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion},
author = {Yifan Lu and Qi Wu and Jay Zhangjie Wu and Zian Wang and Huan Ling and Sanja Fidler and Xuanchi Ren},
journal= {arXiv preprint arXiv:2605.23902},
year = {2026}
}
备注
Project Page: https://research.nvidia.com/labs/sil/projects/pid/