蒸馆解码 2:基于条件得分蒸馆的一步图像自回归模型采样
机器学习
2025-10-27 v1
摘要
图像自回归(AR)模型已成为强大的视觉生成模型范式。尽管其前景广阔,但因所需的大量采样步骤,导致生成速度较慢。虽然最近提出的蒸馆解码 1(DD1)旨在为图像 AR 模型实现少步采样,但在单步设置下仍出现显著性能下降,且依赖预定义映射,限制了其灵活性。本文提出新方法蒸馆解码 2(DD2),进一步提升单步采样的可行性。不同于 DD1,DD2 不依赖预定义映射。我们将原始 AR 模型视为教师模型,提供每个 token 位置在潜在嵌入空间中条件得分的真实值。基于此,我们提出一种新型条件得分蒸馆损失,以训练单步生成器。具体而言,我们训练独立网络预测生成分布的条件得分,并在每个 token 位置以前导 token 为条件应用得分蒸馆。实验结果表明,DD2 在 ImageNet-256 上实现图像 AR 模型的单步采样,FID 从 3.40 提升至 5.43,仅增加约 57%。相较于最强基线 DD1,DD2 将单步采样与原始 AR 模型之间的差距缩小 67%,同时实现最高 12.3 倍的训练加速。DD2 为实现 AR 模型的单步生成奠定了重要基础,为快速高质量的 AR 模型提供了新的可能性。代码已公开于 https://github.com/imagination-research/Distilled-Decoding-2。
引用
@article{arxiv.2510.21003,
title = {Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation},
author = {Enshu Liu and Qian Chen and Xuefei Ning and Shengen Yan and Guohao Dai and Zinan Lin and Yu Wang},
journal= {arXiv preprint arXiv:2510.21003},
year = {2025}
}
备注
Published at NeurIPS 2025