面向文本到图像扩散模型的一致视频编辑
计算机视觉与模式识别
2023-05-30 v1 人工智能
摘要
现有工作以一次性学习的方式推进了文本到图像(TTI)扩散模型用于视频编辑。尽管这些方法对数据和计算的需求较低,但可能产生与文本提示以及时间序列一致性不佳的结果,限制了其在现实世界中的应用。在本文中,我们提出用一种新颖的 EI 模型来解决上述问题,以\textbf{增}强基于 TTI 框架的视频编辑\textbf{一}致\textbf{性}。具体而言,我们分析并发现不一致问题是由为学习时序信息而新添加到 TTI 模型中的模块引起的。这些模块导致特征空间中的协变量偏移,损害了编辑能力。因此,我们设计 EI 通过两个经典模块来解决上述缺陷:偏移受限时序注意力模块(STAM)和细粗帧注意力模块(FFAM)。首先,通过理论分析,我们证明协变量偏移与层归一化高度相关,因此 STAM 采用\textit{实例中心化}层替代它以保留时序特征的分布。此外,STAM 采用带归一化映射的注意力层来转换时序特征同时约束方差偏移。作为第二部分,我们将 STAM 与一种新颖的 FFAM 相结合,后者高效利用整体帧的细粗空间信息以进一步增强时序一致性。大量实验证明了所提出的 EI 模型在文本驱动视频编辑中的优越性。
引用
@article{arxiv.2305.17431,
title = {Towards Consistent Video Editing with Text-to-Image Diffusion Models},
author = {Zicheng Zhang and Bonan Li and Xuecheng Nie and Congying Han and Tiande Guo and Luoqi Liu},
journal= {arXiv preprint arXiv:2305.17431},
year = {2023}
}