FlashAR:面向自回归图像生成的高效训练后加速
摘要
大规模自回归模型在图像生成方面展现出了卓越的能力。然而,其顺序光栅扫描解码依赖于严格的下一 token 预测,导致推理成本极高。现有的加速方法通常要么引入需要从头进行昂贵预训练的全新生成范式,要么以训练-推理间隙或改变预测目标为代价实现并行生成。在本文中,我们提出了 FlashAR,这是一个轻量级的训练后适应框架,能高效地将预训练的光栅扫描自回归模型适应为基于双向下一 token 预测的高度并行生成器。我们的核心见解是,有效的适应应尽量减少对预训练模型原始训练目标的修改,以保留其学习到的先验。因此,我们保留原始的 AR Head 作为用于行预测的 horizontal head,并引入一个互补的、轻量级的用于列预测的 vertical head。为了促进高效适应,我们从中间层而不是最终层引出 vertical head,从而绕过固有的 horizontal head 偏差。此外,由于水平和垂直预测捕获的互补依赖关系在目标位置上的相对重要性各不相同,我们采用可学习的融合门来动态组合每个位置的两个预测。为了进一步降低适应成本,我们提出了一个两阶段适应流水线:vertical head 首先通过从预训练自回归模型进行适应来初始化,然后与 backbone 联合微调以适应新的解码范式。在 LlamaGen 和 Emu3.5 上的大量实验表明,FlashAR 仅使用原始训练数据的 0.05% 进行轻量级训练后适应,即可在 512x512 图像生成中实现高达 22.9 倍的加速。
引用
@article{arxiv.2605.09430,
title = {FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation},
author = {Junkang Zhou and Yefei He and Feng Chen and Weijie Wang and Bohan Zhuang},
journal= {arXiv preprint arXiv:2605.09430},
year = {2026}
}
备注
Post-training acceleration for autoregressive image generation, code is available at https://lxazjk.github.io/FlashAR/