中文

自回归视觉生成中的下一块预测

计算机视觉与模式识别 2025-03-20 v3

摘要

基于下一词预测(NTP)范式构建的自回归模型在开发统一框架以整合语言和视觉任务方面显示出巨大的潜力。先驱性工作将NTP引入自回归视觉生成任务。本文我们重新思考NTP用于自回归图像生成,并将其扩展为一种新颖的下一块预测(NPP)范式。我们的关键思想是对图像标记进行分组和聚合,形成信息密度更高的块标记。通过将块标记作为更紧凑的输入序列,自回归模型被训练以预测下一个块,从而显著降低计算成本。为了进一步利用图像数据的天然层次结构,我们提出了一种多尺度细粒度块分组策略。通过该策略,训练过程从较大的块大小开始,最终以块大小为1×1的标准NTP结束,从而在不修改原推理过程的前提下维持原始推理。广泛的模型规模实验表明,NPP可将训练成本降低至约0.6倍,同时在ImageNet 256x256生成基准中将图像生成质量提高最高1.0个FID分数。值得注意的是,我们的方法保留了原始的自回归模型架构,而无需引入额外的可训练参数或设计特定的自定义图像标记化器,为增强自回归视觉生成提供了一种灵活且即插即用的解决方案。

关键词

引用

@article{arxiv.2412.15321,
  title  = {Next Patch Prediction for Autoregressive Visual Generation},
  author = {Yatian Pang and Peng Jin and Shuo Yang and Bin Lin and Bin Zhu and Zhenyu Tang and Liuhan Chen and Francis E. H. Tay and Ser-Nam Lim and Harry Yang and Li Yuan},
  journal= {arXiv preprint arXiv:2412.15321},
  year   = {2025}
}

备注

Code: https://github.com/PKU-YuanGroup/Next-Patch-Prediction, v2: add related work "Patch-Level Training for Large Language Models", v3: Add content