中文

Chipmunk:通过动态列稀疏差分实现扩散变换器的免训练加速

计算机视觉与模式识别 2025-06-05 v1 人工智能

摘要

扩散变换器(DiTs)在高质量图像和视频生成方面取得了最先进性能,但在推理时产生了大量计算开销。一个常见观察是DiT潜变量噪声向量在推理步骤间变化缓慢,这表明DiT计算在步骤间可能是冗余的。在本文中,我们旨在通过减少这种冗余来加速推理,而无需额外训练。我们首先研究了两种最先进的开源DiTs中激活在步骤间的变化。我们发现注意力机制和MLP中仅5-25%的值解释了步骤间激活变化的70-90%。这一发现激励了我们的方法Chipmunk,它在推理时使用动态稀疏性仅重新计算变化最快的中间激活,而缓存其余部分。动态稀疏性引入了两个系统挑战:(1) 稀疏注意力和MLP操作倾向于未充分利用GPU张量核心;(2) 在运行时计算动态稀疏性模式和缓存激活都引入开销。为解决这些挑战,Chipmunk首先使用基于体素的输入token重排序来引入列向稀疏性。我们实现了列稀疏内核,利用从全局到共享GPU内存的高效稀疏收集,在93%稀疏度下相比高度优化的密集基线实现了9.3倍加速。其次,Chipmunk将稀疏性模式和缓存更新的计算与其他计算部分(如MLP的第二层)重叠,以隐藏额外延迟。Chipmunk在HunyuanVideo上实现了高达2.16倍的加速,在FLUX.1-dev上实现了1.41倍加速,且未牺牲生成质量。此外,我们表明Chipmunk可以叠加在完整步骤缓存之上,在HunyuanVideo上实现3.72倍加速,在WAN2.1上实现2.67倍加速,在FLUX.1-dev上实现2.25倍加速,且质量影响极小。

关键词

引用

@article{arxiv.2506.03275,
  title  = {Chipmunk: Training-Free Acceleration of Diffusion Transformers with Dynamic Column-Sparse Deltas},
  author = {Austin Silveria and Soham V. Govande and Daniel Y. Fu},
  journal= {arXiv preprint arXiv:2506.03275},
  year   = {2025}
}

备注

10 pages, 4 figures