中文

通过从粗到细的 Token 预测改进自回归图像生成

计算机视觉与模式识别 2025-03-21 v1

摘要

自回归模型通过借鉴语言建模中的序列预测技术在图像生成方面取得了显著成功。然而,将这些方法应用于图像需要通过 VQ-VAE 等向量量化方法对连续像素数据进行离散化。为了缓解 VQ-VAE 中存在的量化误差,近期的工作倾向于使用更大的码本。然而,这会相应扩大词表大小,使自回归建模任务复杂化。本文旨在找到一种既能享受大码本优势又不会增加自回归建模难度的方法。通过经验性研究,我们发现具有相似码字表示的 token 对最终生成图像产生相似的效果,这揭示了大型码本中存在显著的冗余。基于这一洞察,我们提出从粗到细(CTF)预测 token,通过为相似的 token 分配相同的粗标签来实现。我们的框架包含两个阶段:(1) 一个自回归模型,依次预测序列中每个 token 的粗标签;(2) 一个辅助模型,在粗标签的条件下同时预测所有 token 的细粒度标签。在 ImageNet 上的实验证明了我们方法的优越性能,与基线相比,Inception Score 平均提升了 59 个百分点。值得注意的是,尽管增加了推理步骤,我们的方法实现了更快的采样速度。

关键词

引用

@article{arxiv.2503.16194,
  title  = {Improving Autoregressive Image Generation through Coarse-to-Fine Token Prediction},
  author = {Ziyao Guo and Kaipeng Zhang and Michael Qizhe Shieh},
  journal= {arXiv preprint arXiv:2503.16194},
  year   = {2025}
}

备注

Work in progress