MADFormer:用于连续图像生成的混合自回归与扩散 Transformer
计算机视觉与模式识别
2025-06-10 v1 机器学习
摘要
多模态生成的最新进展越来越多地结合了自回归(AR)和基于扩散的方法,以利用它们的互补优势:AR 模型捕捉长程依赖并产生流畅的、上下文感知的输出,而扩散模型在连续潜在空间中运行以精炼高保真视觉细节。然而,现有的混合方法往往缺乏关于如何以及为何在这些范式之间分配模型容量的系统性指导。在本工作中,我们引入了 MADFormer,一种混合自回归与扩散 Transformer,作为分析 AR-扩散权衡的测试平台。MADFormer 将图像生成分割为空间块,使用 AR 层跨块进行单次全局条件化,并使用扩散层在每个块内进行迭代局部精炼。通过在 FFHQ-1024 和 ImageNet 上的对照实验,我们得出了两个关键发现:(1)分块分割显著提高了高分辨率图像的性能,以及(2)垂直混合 AR 和扩散层产生了更好的质量-效率平衡——在受限的推理计算量下将 FID 提升高达 75%。我们的发现为未来的混合生成模型提供了实用的设计原则。
引用
@article{arxiv.2506.07999,
title = {MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation},
author = {Junhao Chen and Yulia Tsvetkov and Xiaochuang Han},
journal= {arXiv preprint arXiv:2506.07999},
year = {2025}
}