中文

从预测到完美:为自回归图像生成引入细化机制

计算机视觉与模式识别 2026-01-29 v2

摘要

自回归(AR)图像生成器通过在因果序列中预测离散图像标记,提供了一种面向语言模型的图像生成方法。然而,与扩散模型不同,AR模型缺乏对先前预测进行细化的机制,限制了其生成质量。本文引入TensorAR,一种新的AR范式,将图像生成从下一个标记预测重新表述为下一个张量预测。通过以滑动方式生成图像块(张量)的重叠窗口,TensorAR实现了对先前生成内容的迭代细化。为防止训练期间信息泄露,我们提出了离散张量噪声方案,通过基于码本索引的噪声扰动输入标记。TensorAR实现为与现有AR模型兼容的即插即用模块。在LlamaGEN、Open-MAGVIT2和RAR上进行的大量实验表明,TensorAR显著提高了自回归模型的生成性能。

关键词

引用

@article{arxiv.2505.16324,
  title  = {From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation},
  author = {Cheng Cheng and Lin Song and Di An and Yicheng Xiao and Xuchong Zhang and Hongbin Sun and Ying Shan},
  journal= {arXiv preprint arXiv:2505.16324},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026