CoCoCo:提升文本引导视频修复以实现更好的一致性、可控性与兼容性
计算机视觉与模式识别
2024-03-19 v1
摘要
近期视频生成领域取得了显著进展,但许多现有方法仍面临一致性差和文本-视频对齐不佳的问题。此外,与已得到充分探索的文本引导图像修复领域相比,该领域缺乏有效的文本引导视频修复技术。为此,本文提出了一种新颖的文本引导视频修复模型,实现了更好的一致性、可控性和兼容性。具体而言,我们引入了一个简单但高效的运动捕获模块以保持运动一致性,设计了实例感知的区域选择而非随机区域选择以获得更好的文本可控性,并采用了一种新颖的策略将一些个性化模型注入到我们的CoCoCo模型中,从而获得更好的模型兼容性。大量实验表明,我们的模型能够生成高质量的视频片段。同时,我们的模型展现出更优的运动一致性、文本可控性和模型兼容性。更多详情请见 [cococozibojia.github.io](cococozibojia.github.io)。
引用
@article{arxiv.2403.12035,
title = {CoCoCo: Improving Text-Guided Video Inpainting for Better Consistency, Controllability and Compatibility},
author = {Bojia Zi and Shihao Zhao and Xianbiao Qi and Jianan Wang and Yukai Shi and Qianyu Chen and Bin Liang and Kam-Fai Wong and Lei Zhang},
journal= {arXiv preprint arXiv:2403.12035},
year = {2024}
}