VideoDirector:通过文本到视频模型实现精确视频编辑
计算机视觉与模式识别
2025-03-20 v3
摘要
尽管典型的 inversion-then-editing 框架在文本到图像(text-to-image, T2I)模型中已展现出有前景的成果,但直接将其扩展到文本到视频(text-to-video, T2V)模型仍面临严重的伪影问题,如颜色闪烁和内容失真。因此,当前的视频编辑方法主要依赖 T2I 模型,这些模型本质上缺乏时序一致性的生成能力,往往导致编辑效果不佳。本文认为典型编辑范式的失败源于:1)时空因素紧密耦合。基于关键点(pivotal)的 inversion 策略难以在视频扩散模型中解耦时空信息;2)复杂的时空布局。基于关键点的 cross-attention 控制在保持未编辑内容方面不足。为解决这些问题,我们提出了时空解耦引导(spatial-temporal decoupled guidance, STDG)和多帧空白文本优化策略,以提供更精确的关键点 inversion 所需的时序线索。此外,我们引入自注意力控制策略以维持对精确局部内容编辑的更高保真度。实验结果表明,我们的方法(称为 VideoDirector)有效地利用了 T2V 模型强大的时序生成能力,产生在准确性、运动平滑性、真实性以及未编辑内容保真度方面均达到最先进水平的编辑视频。
引用
@article{arxiv.2411.17592,
title = {VideoDirector: Precise Video Editing via Text-to-Video Models},
author = {Yukun Wang and Longguang Wang and Zhiyuan Ma and Qibin Hu and Kai Xu and Yulan Guo},
journal= {arXiv preprint arXiv:2411.17592},
year = {2025}
}
备注
15 figures