中文

视觉自回归建模:基于下一尺度预测的可扩展图像生成

计算机视觉与模式识别 2024-06-11 v2 人工智能

摘要

我们提出了视觉自回归建模 (VAR),一种新的生成范式,将图像上的自回归学习重新定义为从粗到细的“下一尺度预测”或“下一分辨率预测”,有别于标准的逐行扫描“下一词元预测”。这种简单、直观的方法使得自回归 (AR) Transformer 能够快速学习视觉分布并具有良好的泛化能力:VAR 首次使类 GPT 的 AR 模型在图像生成上超越了扩散 Transformer。在 ImageNet 256x256 基准上,VAR 显著改进了 AR 基线,将 Frechet inception distance (FID) 从 18.65 降至 1.73,inception score (IS) 从 80.4 提升至 350.2,且推理速度提高约 20 倍。经验证,VAR 在图像质量、推理速度、数据效率和可扩展性等多个维度上均优于 Diffusion Transformer (DiT)。扩大 VAR 模型的规模表现出清晰的幂律缩放定律,类似于在 LLM 中观察到的那样,线性相关系数接近 -0.998 即为有力证据。VAR 进一步在包括图像修复、图像外扩和编辑等下游任务中展示了零样本泛化能力。这些结果表明,VAR 已经初步模拟了 LLM 的两个重要特性:缩放定律和零样本任务泛化。我们已发布所有模型和代码,以促进对 AR/VAR 模型在视觉生成和统一学习方面的探索。

关键词

引用

@article{arxiv.2404.02905,
  title  = {Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction},
  author = {Keyu Tian and Yi Jiang and Zehuan Yuan and Bingyue Peng and Liwei Wang},
  journal= {arXiv preprint arXiv:2404.02905},
  year   = {2024}
}

备注

Demo website: https://var.vision/