在生成之前理解:自回归图像生成的自引导训练
计算机视觉与模式识别
2025-09-19 v1
摘要
近期研究已证明高质量视觉表示在图像生成中的重要性,并揭示了生成模型在图像理解方面的局限性。作为最初为自然语言设计的生成范式,自回归模型也面临类似的挑战。在这项工作中,我们首次系统地研究了将下一词预测范式应用于视觉领域的机制。我们识别出三个阻碍高层视觉语义学习的关键特性:局部和条件依赖性、步间语义不一致以及空间不变性缺失。我们表明,通过在训练中引入自监督目标,这些问题可以得到有效解决,从而提出了一种新的训练框架——自回归模型的自引导训练 (ST-AR)。ST-AR 不依赖预训练表示模型,显著增强了自回归模型的图像理解能力并提升了生成质量。具体而言,ST-AR 在保持相同采样策略的情况下,为 LlamaGen-L 带来了约 42% 的 FID 改善,为 LlamaGen-XL 带来了约 49% 的 FID 改善。
引用
@article{arxiv.2509.15185,
title = {Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation},
author = {Xiaoyu Yue and Zidong Wang and Yuqing Wang and Wenlong Zhang and Xihui Liu and Wanli Ouyang and Lei Bai and Luping Zhou},
journal= {arXiv preprint arXiv:2509.15185},
year = {2025}
}
备注
Accepted by NeurIPS 2025