中文

PixNerd:像素神经场扩散

计算机视觉与模式识别 2025-08-05 v2

摘要

当前扩散 Transformer 的成功在很大程度上依赖于预训练变分自编码器(VAE)所塑造的压缩潜在空间。然而,这种两阶段训练范式不可避免地引入了累积误差和解码伪影。为了解决上述问题,研究人员以复杂的级联流水线和增加的 token 复杂度为代价,重新回到像素空间。与他们的努力不同,我们提出使用神经场对分块解码进行建模,并提出了一种单尺度、单阶段、高效的端到端解决方案,称为像素神经场扩散(PixelNerd)。得益于 PixNerd 中高效的神经场表示,我们在无需任何复杂级联流水线或 VAE 的情况下,直接在 ImageNet 256×256256\times256 上取得了 2.15 的 FID,在 ImageNet 512×512512\times512 上取得了 2.84 的 FID。我们还将 PixNerd 框架扩展到了文本到图像应用。我们的 PixNerd-XXL/16 在 GenEval 基准上取得了具有竞争力的 0.73 总分,在 DPG 基准上取得了 80.9 总分。

关键词

引用

@article{arxiv.2507.23268,
  title  = {PixNerd: Pixel Neural Field Diffusion},
  author = {Shuai Wang and Ziteng Gao and Chenhui Zhu and Weilin Huang and Limin Wang},
  journal= {arXiv preprint arXiv:2507.23268},
  year   = {2025}
}

备注

a single-scale, single-stage, efficient, end-to-end pixel space diffusion model