更快捷的图像到视频生成:深入探讨CLIP图像嵌入对时空跨注意力的影响
计算机视觉与模式识别
2024-07-30 v1 人工智能
摘要
本文探讨了CLIP图像嵌入在Stable Video Diffusion(SVD)框架中的作用,重点关注其对视频生成质量和计算效率的影响。我们的发现表明,尽管CLIP嵌入对于观感质量至关重要,但对视频输出的主体和背景一致性贡献并不显著。此外,计算密集的跨注意力机制可以被有效替换为一个更简单的线性层。该层仅在第一次扩散推理步骤中计算,其输出随后被缓存并在整个推理过程中重用,从而在保持高质量输出的同时提高了效率。基于这些见解,我们引入了VCUT(Video Conditional Unfolding via Training-free),一种针对SVD架构优化的训练自由方法。VCUT消除时序跨注意力,并将空间跨注意力替换为一次性计算的线性层,显著降低了计算负载。VCUT的实施导致每个视频的计算量(MACs)减少最高可达322T,模型参数减少最高可达50M,实现了约20%的延迟降低。我们的方法表明,在语义绑定阶段进行条件控制足以,无需在所有推理步骤中持续计算,从而为高效视频生成树立了新标准。
引用
@article{arxiv.2407.19205,
title = {Faster Image2Video Generation: A Closer Look at CLIP Image Embedding's Impact on Spatio-Temporal Cross-Attentions},
author = {Ashkan Taghipour and Morteza Ghahremani and Mohammed Bennamoun and Aref Miri Rekavandi and Zinuo Li and Hamid Laga and Farid Boussaid},
journal= {arXiv preprint arXiv:2407.19205},
year = {2024}
}