ACDiT:内插自回归条件建模与扩散Transformer
计算机视觉与模式识别
2026-01-30 v3
摘要
自回归模型和扩散模型分别在语言模型和视觉生成领域取得了显著进展。我们提出ACDiT,一种新颖的自回归分块条件扩散Transformer,创新性地将自回归和扩散范式结合起来用于连续视觉信息。通过引入分块自回归单元,ACDiT提供了在逐token自回归和全序列扩散之间的灵活内插,绕过了离散token化的限制。每个块的生成被形式化为一个条件扩散过程,以先前的块为条件。ACDiT易于实现,只需在训练期间对标准扩散Transformer应用一个专门设计的跳跃因果注意力掩码。在推理过程中,该过程在扩散去噪和自回归解码之间迭代,可充分利用KV-Cache。我们在图像、视频和文本生成上验证了ACDiT的有效性,并表明在相似模型规模下,ACDiT在视觉生成任务上的表现优于所有自回归基线。我们还证明,得益于自回归建模,预训练的ACDiT尽管以生成目标进行训练,仍可迁移到视觉理解任务中。对自回归与扩散之间权衡的分析展示了ACDiT用于长时域视觉生成任务的潜力。我们希望ACDiT为视觉自回归生成提供一个新颖的视角,并为统一模型的新途径带来启发。
引用
@article{arxiv.2412.07720,
title = {ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer},
author = {Jinyi Hu and Shengding Hu and Yuxuan Song and Yufei Huang and Mingxuan Wang and Hao Zhou and Zhiyuan Liu and Wei-Ying Ma and Maosong Sun},
journal= {arXiv preprint arXiv:2412.07720},
year = {2026}
}
备注
TMLR camera-ready version