中文

自动回归视觉生成需要序言

计算机视觉与模式识别 2026-05-08 v1 人工智能 机器学习

摘要

本文提出Prologue方法,用于弥合自动回归(AR)图像生成中的重建-生成鸿沟。相对于修改视觉标记以满足重建和生成两个要求,Prologue生成一小组预置在视觉标记序列前面的序言标记。这些序言标记仅通过AR交叉熵(CE)损失进行训练,而视觉标记保持专用于重建。这种解耦设计让我们能够通过AR模型的真实分布优化生成,而不影响重建质量,我们进一步从ELBO视角对此进行形式化。在ImageNet 256x256上,Prologue-Base在不使用分类器自由指导的情况下,将gFID从21.01降至10.75,同时保持重建基本不变;Prologue-Large使用标准AR模型无需额外语义监督,达到竞争性的rFID为0.99和gFID为1.46。有趣的是,仅受AR梯度驱动,序言标记会展现出涌现的语义结构:对16个序言标记进行线性探测,Top-1准确率达到35.88%,远高于标准标记化器前16个标记的23.71%;使用固定序言标记进行重采样,可保留类似的高层语义布局。我们的结果表明,一个新方向:通过引入独立学习的生成表示来提高生成质量,同时保留原始表示。

关键词

引用

@article{arxiv.2605.06137,
  title  = {Autoregressive Visual Generation Needs a Prologue},
  author = {Bowen Zheng and Weijian Luo and Guang Yang and Colin Zhang and Tianyang Hu},
  journal= {arXiv preprint arXiv:2605.06137},
  year   = {2026}
}