Mirai:自动递减视觉生成需要前瞻
计算机视觉与模式识别
2026-04-14 v2
摘要
自动递减(Autoregressive, AR)视觉生成器将图像建模为离散标记序列,并以 next-token 概率目标进行训练。这种严格的因果监督仅基于immediate next token 优化每个步骤,可能削弱全局一致性并减缓收敛速度。我们检验前瞻(foresight)——即来自后续标记的训练信号——是否能改善自动递减视觉生成。我们沿着注入水平、前瞻布局和前瞻来源三个维度开展一系列受控诊断,揭示关键洞见:将前瞻与 AR 模型在二维图像网格上的内部表示对齐可提升因果建模效果。我们以 Mirai(日语意为“未来”)为此构想,构建一个无需架构改动、无需额外推理开销的通用框架,将前瞻信息注入 AR 训练:Mirai-E 使用来自单向表示多个未来位置的显式前瞻,而 Mirai-I 则利用来自匹配双向表示的隐式前瞻。大量实验表明,Mirai 显著加速收敛并提升生成质量。例如,Mirai 可使 LlamaGen-B 收敛速度提升最高可达 10 倍,并将 ImageNet 类别条件图像生成基准中的 FID 从 5.34 降至 4.34。我们的研究表明,视觉自回归模型需要前瞻。
引用
@article{arxiv.2601.14671,
title = {Mirai: Autoregressive Visual Generation Needs Foresight},
author = {Yonghao Yu and Lang Huang and Zerun Wang and Runyi Li and Toshihiko Yamasaki},
journal= {arXiv preprint arXiv:2601.14671},
year = {2026}
}