PixelGen:通过感知监督改进像素扩散
计算机视觉与模式识别
2026-05-08 v2 人工智能
摘要
像素扩散直接在像素空间生成图像,避免了双阶段潜在扩散中的 VAE 伪影和表示瓶颈。最近的 JiT 进一步简化了像素扩散,采用 x-预测,即模型预测干净的图像而非速度。然而,标准的像素级扩散损失对所有像素相等地加权,模型资源常被感知上不重要的信号所占用,导致生成样本常常模糊。我们提出 PixelGen,一个以 x-预测为基础、增添感知监督的端到端像素扩散框架。具体而言,PixelGen 在 x-预测之上引入两种互补的感知损失:一种用于局部纹理的 LPIPS 损失,一种用于全局语义的 P-DINO 损失。为保持样本覆盖性,PixelGen 进一步提出一种噪声门控策略,仅在低噪声时间步应用这些损失。在 ImageNet-256 上无需分类器-free guidance 的情况下,PixelGen 在 80 个训练 epoch 即可实现 FID 为 5.11,超越潜在扩散基线。此外,PixelGen 对文本到图像生成扩展效率高,仅用 6 天时间训练 8xH800 GPU 即可达到 GenEval 分数 0.79。这些结果表明,感知监督显著缩小了像素扩散与潜在扩散之间的差距,同时保持简单的一阶段管线。代码:https://github.com/Zehong-Ma/PixelGen
引用
@article{arxiv.2602.02493,
title = {PixelGen: Improving Pixel Diffusion with Perceptual Supervision},
author = {Zehong Ma and Ruihan Xu and Shiliang Zhang},
journal= {arXiv preprint arXiv:2602.02493},
year = {2026}
}
备注
Project Pages: https://zehong-ma.github.io/PixelGen/