Direct-a-Video:用户导向的自定义视频生成中的相机运动与物体运动控制
计算机视觉与模式识别
2024-05-07 v2
摘要
最近的文本到视频扩散模型取得了显著进展。实际应用中,用户常希望独立控制物体运动和相机运动,以实现自定义视频创作。然而,现有方法缺乏对物体运动和相机运动的解耦式独立控制,限制了文本到视频模型的可控性和灵活性。本文引入Direct-a-Video系统,允许用户独立指定多个物体的运动以及相机的平移和缩放运动,仿佛指挥视频制作。我们提出一种简单而有效的策略,用于解耦控制物体运动和相机运动。物体运动通过利用模型内在先验进行空间跨注意力调制实现,无需额外优化。对于相机运动,我们引入新的时间跨注意力层以解释定量的相机运动参数。进一步采用数据增强方法在小规模数据集上进行自监督训练,无需明确运动标注。两个组件独立工作,支持单独或组合控制,并可推广到开放领域场景。大量实验表明,我们方法的卓越性和有效性。项目页面和代码已公开于 https://direct-a-video.github.io/。
引用
@article{arxiv.2402.03162,
title = {Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion},
author = {Shiyuan Yang and Liang Hou and Haibin Huang and Chongyang Ma and Pengfei Wan and Di Zhang and Xiaodong Chen and Jing Liao},
journal= {arXiv preprint arXiv:2402.03162},
year = {2024}
}