MotionCraft:基于物理的零样本视频生成
机器学习
2024-10-28 v2 人工智能
计算机视觉与模式识别
摘要
生成具有真实且物理合理运动的视频是计算机视觉近期的主要挑战之一。虽然扩散模型在图像生成方面取得了令人瞩目的成果,但视频扩散模型受到繁重训练和庞大模型的限制,导致生成的视频仍然偏向于训练数据集。在这项工作中,我们提出了MotionCraft,一种新的零样本视频生成器,用于制作基于物理的逼真视频。MotionCraft能够通过应用从物理模拟导出的光流,扭曲图像扩散模型(如Stable Diffusion)的噪声潜空间。我们表明,扭曲噪声潜空间可以实现所需运动的一致应用,同时允许模型生成与场景演变一致的缺失元素,而如果光流应用于像素空间,则会导致伪影或内容缺失。我们将我们的方法与最先进的Text2Video-Zero进行比较,报告了定性和定量改进,证明了我们的方法在生成具有精细指定复杂运动动态的视频方面的有效性。项目页面:https://mezzelfo.github.io/MotionCraft/
引用
@article{arxiv.2405.13557,
title = {MotionCraft: Physics-based Zero-Shot Video Generation},
author = {Luca Savant Aira and Antonio Montanaro and Emanuele Aiello and Diego Valsesia and Enrico Magli},
journal= {arXiv preprint arXiv:2405.13557},
year = {2024}
}