无注意力机制的扩散模型
计算机视觉与模式识别
2023-12-01 v1 机器学习
摘要
在近期高保真图像生成的进展中,去噪扩散概率模型(DDPMs)已成为关键角色。然而,其在高分辨率下的应用面临显著的计算挑战。当前方法(如分块化)在 UNet 与 Transformer 架构中加快了过程,却以牺牲表征能力为代价。为此,我们引入扩散状态空间模型(DiffuSSM),一种以更具可扩展性的状态空间模型骨干替代注意力机制的架构。该方法有效处理更高分辨率而无需全局压缩,从而在扩散过程中保留精细图像表征。我们聚焦于扩散训练中 FLOP 高效的架构,标志着重要一步。在 ImageNet 与 LSUN 数据集上以两种分辨率的全面评估表明,DiffuSSM 在 FID 与 Inception Score 指标上与带注意力模块的现有扩散模型相当甚至更优,同时显著降低了总 FLOP 用量。
引用
@article{arxiv.2311.18257,
title = {Diffusion Models Without Attention},
author = {Jing Nathan Yan and Jiatao Gu and Alexander M. Rush},
journal= {arXiv preprint arXiv:2311.18257},
year = {2023}
}