中文

用于视觉合成的生成性细化网络

计算机视觉与模式识别 2026-04-15 v1

摘要

虽然扩散模型主导了视觉生成领域,但其计算效率低下,无论不同复杂度如何,都施加均匀的计算资源。相比之下,自回归(AR)模型天生具备复杂度感知能力,正如其可变似然性所示,但常因损失的离散分词和误差积累受限。在本工作中,我们引入生成性细化网络(GRN),这是一种面向视觉合成的下一代范式,以解决上述问题。GRN 通过实现近乎无损的层次二进制量化(HBQ),解决了离散分词瓶颈,重建质量接近连续模型。在 HBQ 的潜在空间上,GRN 基本上升级了 AR 生成,引入全局细化机制,逐步完善和纠正作品——就像人类艺术家绘画一样。此外,GRN 集成了基于熵的采样策略,实现复杂度感知、自适应步长的生成,而不牺牲视觉质量。在 ImageNet 基准上,GRN 在图像重建(0.56 rFID)和类别条件图像生成(1.81 gFID)方面均创下新纪录。我们还将 GRN 扩展到更具挑战性的文本到图像和文本到视频生成,在相同规模上实现卓越性能。我们发布所有模型和代码,以推动 GRN 进一步研究。

关键词

引用

@article{arxiv.2604.13030,
  title  = {Generative Refinement Networks for Visual Synthesis},
  author = {Jian Han and Jinlai Liu and Jiahuan Wang and Bingyue Peng and Zehuan Yuan},
  journal= {arXiv preprint arXiv:2604.13030},
  year   = {2026}
}

备注

code: https://github.com/MGenAI/GRN