中文

探索视觉 Transformer 作为扩散模型学习器

计算机视觉与模式识别 2022-12-29 v1

摘要

基于分数的扩散模型已引起广泛关注,并推动了近期视觉生成任务的快速进展。在本文中,我们关注此前被严重忽视的扩散模型骨干网络。我们系统地探索视觉 Transformer 作为各种生成任务的扩散学习器。通过我们的改进,基于原始 ViT 的骨干网络(IU-ViT)性能得到提升,达到与传统基于 U-Net 的方法相当的水平。我们进一步提出一种假设,关于将生成骨干网络解耦为编码器-解码器结构的含义,并展示概念验证实验,验证采用非对称编码器解码器(ASCEND)的更强编码器在生成任务中的有效性。我们的改进在 CIFAR-10、CelebA、LSUN、CUB Bird 和高分辨率文本到图像任务上取得了具有竞争力的结果。据我们所知,我们首次成功地在超出 64x64 分辨率的文本到图像任务上训练单一扩散模型。我们希望这将激励人们重新思考基于扩散的生成模型的建模选择与训练流程。

关键词

引用

@article{arxiv.2212.13771,
  title  = {Exploring Vision Transformers as Diffusion Learners},
  author = {He Cao and Jianan Wang and Tianhe Ren and Xianbiao Qi and Yihao Chen and Yuan Yao and Lei Zhang},
  journal= {arXiv preprint arXiv:2212.13771},
  year   = {2022}
}