按尺度自回归生成中的训练动力学再思考
计算机视觉与模式识别
2025-12-09 v1 人工智能
计算与语言
机器学习
摘要
最近的自回归 (AR) 生成模型取得了快速进展,构建了越来越强大的媒体合成系统。在其中,尺度预测作为流行范式,模型以粗到细的方式生成图像。然而,尺度 AR 模型受到暴露偏差的影响,削弱了生成质量。我们识别了两个主要原因:(1) 训练-测试不匹配,模型在推理时必须依赖自身 imperfect 预测;(2) 尺度学习难度不平衡,某些尺度显示出远高于其他尺度的优化复杂度。通过对训练动力学的全面分析,我们提出 Self-Autoregressive Refinement (SAR) 来解决这些限制。SAR 引入 Stagger-Scale Rollout (SSR) 机制,对模型进行轻量级自回归 rollout,以暴露其中间预测,从而实现训练-测试模式的一致;同时引入对比 Student-Forcing Loss (CSFL),为自生成上下文提供充分监督,以确保训练稳定。实验结果表明,将 SAR 应用于预训练 AR 模型可在最小计算开销下持续提高生成质量。例如,在 ImageNet 256 上训练的 FlexVAR-d16 上,SAR 可在 10 个 epoch(32 块 A100 GPU 上 5 小时)内实现 5.2% 的 FID 降低。鉴于其效率、可扩展性和有效性,我们期望 SAR 成为视觉自回归生成的可靠后训练方法。
引用
@article{arxiv.2512.06421,
title = {Rethinking Training Dynamics in Scale-wise Autoregressive Generation},
author = {Gengze Zhou and Chongjian Ge and Hao Tan and Feng Liu and Yicong Hong},
journal= {arXiv preprint arXiv:2512.06421},
year = {2025}
}