MotionMaster:无需训练的摄像运动视频生成
计算机视觉与模式识别
2024-05-02 v2
摘要
扩散模型的出现大大推动了图像和视频生成的进展。最近,一些努力被用于可控视频生成,包括文本到视频生成和视频运动控制,其中相机运动控制是一个重要议题。然而,现有的相机运动控制方法依赖于训练时间相机模块,由于视频生成模型参数庞大,需大量计算资源。此外,现有方法在训练时预定义相机运动类型,限制了其在相机控制中的灵活性。为减少训练成本并实现灵活的相机控制,我们提出了 COMD,这是一个新的无训练视频运动迁移模型,该模型分离源视频中的相机运动和物体运动,并将提取的相机运动迁移到新视频中。我们首先提出一种单次相机运动分离方法,从单个源视频中提取相机运动,通过求解泊松方程来分离移动对象与背景,并基于背景中的运动估计移动对象区域的相机运动。此外,我们提出了少量相机运动分离方法,从多个相机运动相似的视频中提取常见的相机运动,采用基于窗口的聚类技术从多个视频的注意力图中提取常见特征。最后,我们提出了运动组合方法,将不同类型的相机运动组合在一起,使模型能够实现更可控和灵活的相机控制。广泛的实验表明,我们的无训练方法能够有效地分离相机-物体运动,并将分离的相机运动应用于广泛的可控视频生成任务,实现灵活和多样的相机运动控制。
引用
@article{arxiv.2404.15789,
title = {MotionMaster: Training-free Camera Motion Transfer For Video Generation},
author = {Teng Hu and Jiangning Zhang and Ran Yi and Yating Wang and Hongrui Huang and Jieyu Weng and Yabiao Wang and Lizhuang Ma},
journal= {arXiv preprint arXiv:2404.15789},
year = {2024}
}