中文

你的 ViT secretly 是一种混合判别-生成扩散模型

计算机视觉与模式识别 2022-08-17 v1

摘要

扩散去噪概率模型(DDPM)和 Vision Transformer(ViT)分别在生成任务和判别任务中展现出显著进展,迄今为止这些模型大多在其各自领域内独立发展。本文通过将 ViT 架构整合进 DDPM,建立了 DDPM 与 ViT 之间的直接联系,并提出了一种称为生成式 ViT(GenViT)的新生成模型。ViT 的建模灵活性使我们能够进一步将 GenViT 扩展为混合判别-生成建模,并引入混合 ViT(HybViT)。我们的工作是首批探索使用单一 ViT 联合进行图像生成与分类的研究之一。我们进行了一系列实验来分析所提模型的性能,并证明了它们在生成和判别任务上相对于先前 SOTA 方法的优越性。我们的代码和预训练模型可在 https://github.com/sndnyang/Diffusion_ViT 获取。

关键词

引用

@article{arxiv.2208.07791,
  title  = {Your ViT is Secretly a Hybrid Discriminative-Generative Diffusion Model},
  author = {Xiulong Yang and Sheng-Min Shih and Yinlin Fu and Xiaoting Zhao and Shihao Ji},
  journal= {arXiv preprint arXiv:2208.07791},
  year   = {2022}
}