中文

PixelFlow:基于流的像素空间生成模型

计算机视觉与模式识别 2025-04-11 v1

摘要

我们提出了 PixelFlow,一系列直接在原始像素空间中运行的图像生成模型,这与主流的潜在空间模型形成对比。这种方法消除了对预训练变分自编码器(VAE)的需求,并使整个模型能够端到端训练,从而简化了图像生成过程。通过高效的级联流建模,PixelFlow 在像素空间中实现了可承受的计算成本。它在 256×\times256 ImageNet 类条件图像生成基准上达到了 1.98 的 FID。定性的文本到图像结果表明,PixelFlow 在图像质量、艺术性和语义控制方面表现出色。我们希望这一新范式能够启发并为下一代视觉生成模型开辟新的机遇。代码和模型可在 https://github.com/ShoufaChen/PixelFlow 获取。

关键词

引用

@article{arxiv.2504.07963,
  title  = {PixelFlow: Pixel-Space Generative Models with Flow},
  author = {Shoufa Chen and Chongjian Ge and Shilong Zhang and Peize Sun and Ping Luo},
  journal= {arXiv preprint arXiv:2504.07963},
  year   = {2025}
}

备注

Technical report. Code: https://github.com/ShoufaChen/PixelFlow