MotionZero:利用运动先验实现零样本文本到视频生成
计算机视觉与模式识别
2023-11-29 v1
摘要
零样本文本到视频合成基于提示词生成视频而无需任何视频。由于缺乏来自视频的运动信息,提示词中隐含的运动先验成为至关重要的引导。例如,提示词“飞机降落在跑道上”表明运动先验:“飞机”向下移动而“跑道”保持静止。然而先前方法未充分挖掘运动先验,从而导致两个 nontrivial 问题:1)因忽视运动先验,运动变化模式保持未改变且与提示词无关;2)未考虑不同对象的独立运动先验,导致不同对象的运动控制不准确且相互纠缠。为解决这两个问题,我们提出一种称为 MotionZero 的提示自适应且解耦的运动控制策略,其通过大语言模型(Large-Language-Models)从各对象的提示词导出运动先验,并相应地将不同对象的运动控制以解耦方式应用于对应区域。此外,为生成具有不同运动幅度程度的视频,我们提出一种运动感知注意力(Motion-Aware Attention)方案,依据运动幅度调整帧间注意力。大量实验表明,我们的策略能正确控制不同对象的运动,并支持包括零样本视频编辑在内的多种应用。
引用
@article{arxiv.2311.16635,
title = {MotionZero:Exploiting Motion Priors for Zero-shot Text-to-Video Generation},
author = {Sitong Su and Litao Guo and Lianli Gao and Hengtao Shen and Jingkuan Song},
journal= {arXiv preprint arXiv:2311.16635},
year = {2023}
}