通过时间注意力分解加速扩散模型
计算机视觉与模式识别
2025-02-27 v3
摘要
我们探索了文本条件扩散模型在推理过程中注意力机制的作用。经验观察表明,交叉注意力输出在若干推理步骤后收敛到一个固定点。收敛时间自然地将整个推理过程分为两个阶段:一个初始阶段用于规划面向文本的视觉语义,这些语义随后在后续的保真度提升阶段被转化为图像。交叉注意力在初始阶段至关重要,但此后几乎无关紧要。然而,自注意力最初作用较小,但在第二阶段变得关键。这些发现产生了一种简单且无需训练的方法,称为时间门控注意力(TGATE),该方法通过在计划的时间步缓存和重用注意力输出来高效生成图像。实验结果表明,当广泛应用于各种现有文本条件扩散模型时,TGATE可将这些模型加速10%-50%。TGATE的代码可在https://github.com/HaozheLiu-ST/T-GATE获取。
引用
@article{arxiv.2404.02747,
title = {Faster Diffusion via Temporal Attention Decomposition},
author = {Haozhe Liu and Wentian Zhang and Jinheng Xie and Francesco Faccio and Mengmeng Xu and Tao Xiang and Mike Zheng Shou and Juan-Manuel Perez-Rua and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2404.02747},
year = {2025}
}
备注
Accepted by TMLR: https://openreview.net/forum?id=xXs2GKXPnH