中文

MonoFormer:一个 Transformer 同时用于扩散与自回归

计算机视觉与模式识别 2024-09-25 v1

摘要

大多数现有的多模态方法在基于自回归的离散文本生成和基于扩散的连续视觉生成中使用独立的骨干网络,或者通过将视觉数据离散化以对文本和视觉生成都使用自回归的同一骨干网络。在本文中,我们提出研究一个简单的想法:在自回归和扩散之间共享一个 Transformer。其可行性主要来自两个方面:Transformer 已成功应用于扩散进行视觉生成;用于自回归和扩散的 Transformer 训练非常相似,区别仅在于扩散使用双向注意力掩码,而自回归使用因果注意力掩码。实验结果表明,我们的方法实现了与当前最先进方法相当的图像生成性能,同时保持了文本生成能力。该项目公开于 https://monoformer.github.io/。

关键词

引用

@article{arxiv.2409.16280,
  title  = {MonoFormer: One Transformer for Both Diffusion and Autoregression},
  author = {Chuyang Zhao and Yuxing Song and Wenhao Wang and Haocheng Feng and Errui Ding and Yifan Sun and Xinyan Xiao and Jingdong Wang},
  journal= {arXiv preprint arXiv:2409.16280},
  year   = {2024}
}