中文

探索用于图像扩散模型的 Transformer 骨干网络

计算机视觉与模式识别 2023-01-02 v1

摘要

我们提出了一种基于端到端 Transformer 的隐扩散模型用于图像合成。在 ImageNet 类条件生成任务上,我们展示了基于 Transformer 的隐扩散模型取得了 14.1 FID,与基于 UNet 架构的 13.1 FID 分数相当。除了展示 Transformer 模型在基于扩散的图像合成中的应用外,这种架构上的简化使得文本和图像数据的融合与建模变得容易。Transformer 的多头注意力机制实现了图像与文本特征之间简化的交互,从而消除了基于 UNet 的扩散模型中对交叉注意力机制的需求。

关键词

引用

@article{arxiv.2212.14678,
  title  = {Exploring Transformer Backbones for Image Diffusion Models},
  author = {Princy Chahal},
  journal= {arXiv preprint arXiv:2212.14678},
  year   = {2023}
}