视频扩散模型注意力机制解析
组合数学
2025-04-17 v1
摘要
文本到视频 (T2V) 合成模型,如 OpenAI 的 Sora,因其能够从文本提示生成高质量视频而受到广泛关注。在基于扩散的 T2V 模型中,注意力机制是关键组件。然而,仍不清楚学习到的中间特征是什么,以及 T2V 模型中的注意力块如何影响视频合成的 various aspects,包括图像质量和时序一致性。本文采用信息论方法,对 T2V 模型的空间注意力和时间注意力块进行深入的扰动分析。我们的结果表明,时序注意力图和空间注意力图不仅影响视频的时间布局和布局,还影响时空元素的复杂度以及合成视频的审美质量。值得注意的是,高熵注意力图通常与优异视频质量相关联,而低熵注意力图则与视频的帧内结构相关联。基于我们的发现,我们提出两种新方法来增强视频质量并实现文本引导的视频编辑。这些方法完全依赖对 T2V 模型注意力矩阵的轻量级操作。通过在多个数据集上的实验评估,我们进一步验证了这些方法的有效性和效果。
引用
@article{arxiv.2504.12026,
title = {Neumaier graphs from cyclotomy with small coherent rank},
author = {Gary R. W. Greaves and Zhao Kuang Tan},
journal= {arXiv preprint arXiv:2504.12026},
year = {2025}
}
备注
25 pages