自回归 Transformer 与扩散模型的融合:多参考自回归方法
计算机视觉与模式识别
2025-08-21 v3
摘要
我们提出了 TransDiff——首个将自回归(AR)Transformer 与扩散模型相结合的图像生成模型。在这一联合建模框架中,TransDiff 将标签和图像编码为高层语义特征,并利用扩散模型估计图像样本的分布。在 ImageNet 256×256 基准测试上,TransDiff 显著优于基于独立 AR Transformer 或扩散模型的其他图像生成模型。具体而言,TransDiff 实现了 Frechet 起始距离(FID)1.61 和起始分数(IS)293.4,并且相比基于 AR Transformer 的最先进方法推理延迟降低 x2 倍,相比纯扩散模型推理延迟降低 x112 倍。此外,基于 TransDiff 模型,我们提出了一种新颖的图像生成范式——多参考自回归(Multi-Reference Autoregression, MRAR),它通过预测下一张图像进行自回归生成。MRAR 使模型能够参考多个先前生成的图像,从而促进学习更多样化的表示,并在后续迭代中提高生成图像的质量。应用 MRAR 后,TransDiff 的性能得到提升,FID 从 1.61 降至 1.42。我们期望 TransDiff 为图像生成领域开辟新的前沿。
引用
@article{arxiv.2506.09482,
title = {Marrying Autoregressive Transformer and Diffusion with Multi-Reference Autoregression},
author = {Dingcheng Zhen and Qian Qiao and Xu Zheng and Tan Yu and Kangxi Wu and Ziwei Zhang and Siyuan Liu and Shunshun Yin and Ming Tao},
journal= {arXiv preprint arXiv:2506.09482},
year = {2025}
}