不留缓存闲置:通过极限精简缓存加速扩散模型
计算机视觉与模式识别
2025-12-16 v1
摘要
扩散模型实现了出色的生成质量,但计算开销随步数、模型深度和序列长度的增加而增加。特征缓存非常有效,因为相邻时间步产生高度相似的特征。然而,仍存在固有的权衡:激进的时间步复用能带来大幅加速,但极易越过临界线从而损害保真度;而块级或 token 级复用更安全,但计算节省有限。我们提出了 X-Slim(极限精简缓存),一种免训练的基于缓存的加速器,据我们所知,这是首个跨时间步、结构(块)和空间统一利用可缓存冗余的框架。X-Slim 并非简单混合不同层级,而是引入了双阈值控制器,将缓存转化为“先推后磨”过程:首先在时间步层级推进复用直至预警线,随后切换至轻量级的块级和 token 级刷新以打磨剩余冗余,并在越过临界线时触发完整推理以重置累积误差。在每个层级,上下文感知指标决定何时何地进行缓存。在多种任务上,X-Slim 推进了速度-质量前沿。在 FLUX.1-dev 和 HunyuanVideo 上,它分别将延迟降低了 4.97 倍和 3.52 倍,且感知损失极小。在 DiT-XL/2 上,它实现了 3.13 倍的加速,且较先前方法将 FID 改善了 2.42。
引用
@article{arxiv.2512.12604,
title = {No Cache Left Idle: Accelerating diffusion model via Extreme-slimming Caching},
author = {Tingyan Wen and Haoyu Li and Yihuang Chen and Xing Zhou and Lifei Zhu and Xueqian Wang},
journal= {arXiv preprint arXiv:2512.12604},
year = {2025}
}
备注
Project page: https://thu-accdiff.github.io/xslim-page/ Code: https://github.com/THU-AccDiff/xslim