中文

蒸馆解码 1:使用流匹配实现图像自回归模型的一步采样

计算机视觉与模式识别 2025-10-27 v3 机器学习

摘要

自回归(AR)模型在文本和图像生成中取得了最先进的性能,但因逐 token 生成过程而存在速度较慢的问题。我们提出了一个 ambitious 的问题:是否可以将预训练的 AR 模型适配为仅用一或两个步骤生成输出?如果成功,这将显著推动 AR 模型的开发和部署。我们注意到,现有尝试一次生成多个 token 以加速 AR 生成的工作,由于无法捕捉 token 之间的条件依赖关系,限制了其在少数步骤生成中的有效性。为此,我们提出了蒸馆解码(Distilled Decoding, DD),其使用流匹配(flow matching)创建从高斯分布到预训练 AR 模型输出分布的确定性映射。随后,我们训练一个网络来蒸馆此映射,从而实现少数步骤生成。DD 不需要原始 AR 模型的训练数据,因此更加实用。我们在最先进的图像 AR 模型上评估了 DD,并在 ImageNet-256 上呈现出有前景的结果。对于 VAR,需要 10 步生成,DD 实现一步生成(实现 6.3×6.3\times 加速),FID 从 4.19 提升至 9.96,增加的 FID 仍在可接受范围内。对于 LlamaGen,DD 将生成步数从 256 降至 1,实现 217.8×217.8\times 加速,FID 从 4.11 提升至 11.35。在两种情况下,基线方法的 FID 均超过 100。DD 也在文本到图像生成中表现突出,将 LlamaGen 的生成步数从 256 降至 2,FID 从 25.70 提升至 28.95,增加幅度有限。作为首个实现图像 AR 模型一步生成的工作,DD 挑战了 AR 模型天生较慢的普遍观念,为高效 AR 生成开辟了新机遇。项目网址为 https://imagination-research.github.io/distilled-decoding。

关键词

引用

@article{arxiv.2412.17153,
  title  = {Distilled Decoding 1: One-step Sampling of Image Auto-regressive Models with Flow Matching},
  author = {Enshu Liu and Xuefei Ning and Yu Wang and Zinan Lin},
  journal= {arXiv preprint arXiv:2412.17153},
  year   = {2025}
}