中文

下一视觉粒度生成

计算机视觉与模式识别 2026-03-03 v2 人工智能 机器学习

摘要

我们提出了一种新颖的图像生成方法,通过将图像分解为结构化序列,其中序列中的每个元素共享相同的空间分辨率,但在所使用的唯一标记数目上有所不同,从而捕捉不同层次的视觉粒度。通过引入的下一视觉粒度(NVG)生成框架进行图像生成,该框架从空图像开始,逐步细化,从全局布局到细节,以结构化方式进行。这个迭代过程编码了分层、分层表示,提供了对生成过程在多个粒度水平上进行细粒度控制的能力。我们在 ImageNet 数据集上对一系列 NVG 模型进行类条件图像生成训练,并观察到清晰的规模行为。与 VAR 系列相比,NVG 在 FID 分数上 consistently 优于后者(3.30 \rightarrow 3.03, 2.57 \rightarrow 2.44, 2.09 \rightarrow 2.06)。我们还进行了大量分析,以展示 NVG 框架的能力与潜力。我们的代码和模型已发布于 https://yikai-wang.github.io/nvg。

关键词

引用

@article{arxiv.2508.12811,
  title  = {Next Visual Granularity Generation},
  author = {Yikai Wang and Zhouxia Wang and Zhonghua Wu and Qingyi Tao and Kang Liao and Chen Change Loy},
  journal= {arXiv preprint arXiv:2508.12811},
  year   = {2026}
}

备注

ICLR 2026