CCEdit:基于扩散模型的创意可控视频编辑
计算机视觉与模式识别
2024-04-09 v3
摘要
本文提出CCEdit,一种基于扩散模型的多功能生成式视频编辑框架。我们的方法采用一种新颖的三叉戟网络结构,将结构与外观控制分离,以确保精确且富有创意的编辑能力。利用基础的ControlNet架构,我们在编辑过程中保持视频的结构完整性。额外引入的外观分支使用户能够对编辑后的关键帧进行细粒度控制。这两个侧分支通过可学习的时间层无缝集成到构建于现有文本到图像(T2I)生成模型之上的主分支中。我们框架的多功能性通过结构与表征的多样选择、个性化T2I模型以及提供编辑后关键帧的选项得以展现。为便于全面评估,我们引入BalanceCC基准数据集,包含100个视频且每个视频有4个目标提示。我们广泛的用户研究将CCEdit与八种最先进的视频编辑方法进行比较,结果表明CCEdit相对于所有其他方法具有显著优越性。
引用
@article{arxiv.2309.16496,
title = {CCEdit: Creative and Controllable Video Editing via Diffusion Models},
author = {Ruoyu Feng and Wenming Weng and Yanhui Wang and Yuhui Yuan and Jianmin Bao and Chong Luo and Zhibo Chen and Baining Guo},
journal= {arXiv preprint arXiv:2309.16496},
year = {2024}
}