CHAI: 面向文本到视频生成的缓存注意力推理加速方法
计算机视觉与模式识别
2026-02-19 v1 机器学习
摘要
文本到视频扩散模型能生成令人印象深刻的结果,但由于需要对3D潜在表示进行顺序去噪,其推理速度仍然很慢。现有的加速推理方法要么需要昂贵的模型重新训练,要么使用基于启发式的跳步策略,后者在去噪步数减少时难以保持视频质量。我们的工作CHAI旨在利用跨推理缓存来减少延迟,同时保持视频质量。我们引入了缓存注意力(Cache Attention),作为一种有效的方法来关注跨推理潜在表示中的共享对象/场景。这种选择性注意力机制使得能够在语义相关的提示之间有效重用缓存的潜在表示,从而实现高缓存命中率。我们展示了使用缓存注意力仅需8个去噪步骤即可生成高质量视频。当集成到整个系统中时,CHAI在保持视频质量的同时,比基线OpenSora 1.2快1.65倍至3.35倍。
引用
@article{arxiv.2602.16132,
title = {CHAI: CacHe Attention Inference for text2video},
author = {Joel Mathew Cherian and Ashutosh Muralidhara Bharadwaj and Vima Gupta and Anand Padmanabha Iyer},
journal= {arXiv preprint arXiv:2602.16132},
year = {2026}
}