探索用于图像扩散模型的 Transformer 骨干网络
计算机视觉与模式识别
2023-01-02 v1
摘要
我们提出了一种基于端到端 Transformer 的隐扩散模型用于图像合成。在 ImageNet 类条件生成任务上,我们展示了基于 Transformer 的隐扩散模型取得了 14.1 FID,与基于 UNet 架构的 13.1 FID 分数相当。除了展示 Transformer 模型在基于扩散的图像合成中的应用外,这种架构上的简化使得文本和图像数据的融合与建模变得容易。Transformer 的多头注意力机制实现了图像与文本特征之间简化的交互,从而消除了基于 UNet 的扩散模型中对交叉注意力机制的需求。
引用
@article{arxiv.2212.14678,
title = {Exploring Transformer Backbones for Image Diffusion Models},
author = {Princy Chahal},
journal= {arXiv preprint arXiv:2212.14678},
year = {2023}
}