VideoComposer:具有运动可控性的组合式视频合成
计算机视觉与模式识别
2023-06-07 v2
摘要
将可控性作为视觉内容创作的更高标准,已在可定制图像合成中取得显著进展。然而,由于时间动态的巨大变化以及跨帧时间一致性的要求,实现可控视频合成仍具挑战性。基于组合式生成范式,本工作提出VideoComposer,允许用户利用文本条件、空间条件,更重要的是时间条件灵活地组合视频。具体而言,考虑到视频数据的特性,我们引入压缩视频中的运动向量作为显式控制信号,以提供关于时间动态的引导。此外,我们开发了时空条件编码器(STC-encoder)作为统一接口,有效整合序列输入的空间与时间关系,使模型能更好地利用时间条件从而达成更高的帧间一致性。大量实验结果表明,VideoComposer能够以文本描述、草图序列、参考视频甚至简单手工制作的运动等多种形式,在合成视频中同时控制空间与时间模式。代码与模型将公开于 https://videocomposer.github.io。
引用
@article{arxiv.2306.02018,
title = {VideoComposer: Compositional Video Synthesis with Motion Controllability},
author = {Xiang Wang and Hangjie Yuan and Shiwei Zhang and Dayou Chen and Jiuniu Wang and Yingya Zhang and Yujun Shen and Deli Zhao and Jingren Zhou},
journal= {arXiv preprint arXiv:2306.02018},
year = {2023}
}
备注
The first four authors contributed equally. Project page: https://videocomposer.github.io