中文

超越下一个标记:自回归视觉生成的下一个 X 预测

计算机视觉与模式识别 2025-03-24 v2

摘要

自回归 (AR) 模型以其 next-token 预测范式为语言和视觉生成模型提供了最先进的性能。传统上,'标记' 被视为最小的预测单元,通常是语言中的离散符号或视觉中量化的 patch。然而,针对 2D 图像结构的最优标记定义仍是未解之谜。此外,AR 模型受到暴露偏差的影响,即训练期间的 teacher forcing 导致推理时误差累积。本文提出 xAR,一个通用的 AR 框架,将标记概念扩展为实体 X,可代表单个 patch 标记、cell(相邻 patch 的 k×kk\times k 组合)、subsample(远程 patch 的非局部组合)、scale(粗到细分辨率)或整个图像。我们将离散标记分类重新表述为连续实体回归,利用 flow-matching 方法在每个 AR 步骤中实现。这一方法以噪声实体作为训练条件,导致 Noisy Context Learning,从而有效缓解了暴露偏差。结果表明,xAR 有两大优势:(1) 它实现灵活的预测单元,捕获不同的上下文粒度和空间结构,(2) 通过避免依赖 teacher forcing,缓解了暴露偏差。在 ImageNet-256 生成基准测试中,xAR-B 基线模型 (172M) 在性能上超过 DiT-XL/SiT-XL (675M),同时实现 20 倍更快的推理速度。xAR-H 达到新的最先进成绩,FID 为 1.24,运行速度比前者快 2.2 倍,且无需依赖视觉基础模块(如 DINOv2)或高级指导间隔采样。

关键词

引用

@article{arxiv.2502.20388,
  title  = {Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation},
  author = {Sucheng Ren and Qihang Yu and Ju He and Xiaohui Shen and Alan Yuille and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2502.20388},
  year   = {2025}
}

备注

Project page at \url{https://oliverrensu.github.io/project/xAR}