中文

FEB-Cache: 面向扩散 Transformer 缓存增强的频率引导曝光偏差缓解

计算机视觉与模式识别 2025-10-07 v3 机器学习

摘要

Diffusion Transformer (DiT) 展现了令人印象深刻的生成能力,但由于其高计算复杂性而面临巨大挑战。为解决这一问题,已引入多种方法,特别是特征缓存。然而,这些方法侧重于对齐非缓存扩散,而未分析为何缓存会损害生成过程。在本文中,我们首先确认缓存极大地放大了曝光偏差,导致生成质量下降。然而,由于曝光偏差的非平滑性,直接应用噪声缩放来解决此问题具有挑战性。我们发现这一现象源于其频率响应特性与 Attention 和 MLP 的简单缓存之间的不匹配。由于这两个组件对频率信号表现出独特的偏好,这为我们提供了一种缓存策略,即将 Attention 和 MLP 分离,从而实现对曝光偏差的增强拟合并减少该偏差。基于此,我们引入了 FEB-Cache,这是一种联合缓存策略,它基于频率引导的缓存表对齐无曝光偏差的扩散过程(这为我们提供了更高的性能上限)来缓存 Attention 和 MLP。我们的方法结合了对缓存机制的全面理解,并提供了一种利用缓存加速扩散过程的新视角。实证结果表明,FEB-Cache 在促进加速的同时优化了模型性能。代码可在 https://github.com/aSleepyTree/EB-Cache 获取。

关键词

引用

@article{arxiv.2503.07120,
  title  = {FEB-Cache: Frequency-Guided Exposure Bias Reduction for Enhancing Diffusion Transformer Caching},
  author = {Zhen Zou and Feng Zhao},
  journal= {arXiv preprint arXiv:2503.07120},
  year   = {2025}
}