中文

用于加速自回归文本到图像生成的推测式 Jacobi 去噪解码

计算机视觉与模式识别 2025-10-13 v1

摘要

作为视觉内容生成的新范式,自回归文本到图像模型由于其逐 token 顺序解码过程而推理缓慢,通常需要数千次模型前向传播才能生成一张图像。为解决这一低效问题,我们提出推测式 Jacobi 去噪解码(SJD2),一个将去噪过程融入 Jacobi 迭代以实现自回归模型并行 token 生成的框架。我们的方法引入下一干净 token 预测范式,使预训练的自回归模型能够接受噪声扰动的 token 嵌入,并通过低成本微调预测下一干净 token。该去噪范式引导模型朝向更稳定的 Jacobi 轨迹。在推理阶段,我们的方法以高斯噪声初始化 token 序列,并在嵌入空间中执行迭代式的下一干净 token 预测。我们采用概率准则来并行验证并接受多个 token,并利用去噪轨迹对未接受的 token 进行下一轮精化。实验表明,我们的方法能够在保持生成图像视觉质量的同时,通过减少模型前向传播次数来加速生成。

关键词

引用

@article{arxiv.2510.08994,
  title  = {Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation},
  author = {Yao Teng and Fuyun Wang and Xian Liu and Zhekai Chen and Han Shi and Yu Wang and Zhenguo Li and Weiyang Liu and Difan Zou and Xihui Liu},
  journal= {arXiv preprint arXiv:2510.08994},
  year   = {2025}
}