EffiVED:基于文本指令扩散模型的高效视频编辑
计算机视觉与模式识别
2024-06-06 v2
摘要
大规模文本到视频模型已展现出卓越的能力,但由于可用数据集有限,其在视频编辑中的直接应用仍然具有挑战性。当前的视频编辑方法通常需要对扩散模型进行逐视频微调或特定的反演优化,以确保高保真编辑。在本文中,我们引入了 EffiVED,一种直接支持指令引导视频编辑的高效扩散模型。为实现这一目标,我们提出了两种高效的工作流程来收集视频编辑对,利用数据增强和基础的视觉-语言技术。这些工作流程将海量图像编辑数据集和开放世界视频转化为用于训练 EffiVED 的高质量数据集。实验结果表明,EffiVED 不仅能生成高质量编辑视频,而且执行速度快。最后,我们证明我们的数据收集方法显著提高了编辑性能,并有望解决视频编辑数据的稀缺问题。代码可在 https://github.com/alibaba/EffiVED 找到。
引用
@article{arxiv.2403.11568,
title = {EffiVED:Efficient Video Editing via Text-instruction Diffusion Models},
author = {Zhenghao Zhang and Zuozhuo Dai and Long Qin and Weizhi Wang},
journal= {arXiv preprint arXiv:2403.11568},
year = {2024}
}