中文

MotionZero:利用运动先验实现零样本文本到视频生成

计算机视觉与模式识别 2023-11-29 v1

摘要

零样本文本到视频合成基于提示词生成视频而无需任何视频。由于缺乏来自视频的运动信息,提示词中隐含的运动先验成为至关重要的引导。例如,提示词“飞机降落在跑道上”表明运动先验:“飞机”向下移动而“跑道”保持静止。然而先前方法未充分挖掘运动先验,从而导致两个 nontrivial 问题:1)因忽视运动先验,运动变化模式保持未改变且与提示词无关;2)未考虑不同对象的独立运动先验,导致不同对象的运动控制不准确且相互纠缠。为解决这两个问题,我们提出一种称为 MotionZero 的提示自适应且解耦的运动控制策略,其通过大语言模型(Large-Language-Models)从各对象的提示词导出运动先验,并相应地将不同对象的运动控制以解耦方式应用于对应区域。此外,为生成具有不同运动幅度程度的视频,我们提出一种运动感知注意力(Motion-Aware Attention)方案,依据运动幅度调整帧间注意力。大量实验表明,我们的策略能正确控制不同对象的运动,并支持包括零样本视频编辑在内的多种应用。

关键词

引用

@article{arxiv.2311.16635,
  title  = {MotionZero:Exploiting Motion Priors for Zero-shot Text-to-Video Generation},
  author = {Sitong Su and Litao Guo and Lianli Gao and Hengtao Shen and Jingkuan Song},
  journal= {arXiv preprint arXiv:2311.16635},
  year   = {2023}
}