中文

Animate-A-Story:基于检索增强视频生成的叙事方法

计算机视觉与模式识别 2023-07-14 v1

摘要

为视觉叙事生成视频可能是一个繁琐且复杂的过程,通常需要实景拍摄或图形动画渲染。为规避这些挑战,我们的核心思路是利用大量现有视频片段,并通过定制其外观来合成连贯的叙事视频。我们开发了一个由两大功能模块组成的框架来实现这一点:(i) 运动结构检索,提供由查询文本所描述的所需场景或运动上下文的视频候选,以及 (ii) 结构引导的文本到视频合成,在运动结构和文本提示的指导下生成与情节对齐的视频。对于第一个模块,我们利用现成的视频检索系统并提取视频深度作为运动结构。对于第二个模块,我们提出了一种可控视频生成模型,对结构和角色提供灵活控制。视频通过遵循结构引导和外观指令来合成。为确保各片段间的视觉一致性,我们提出了一种有效的概念个性化方法,允许通过文本提示指定所需角色身份。大量实验表明,我们的方法相较于多种现有基线具有显著优势。

关键词

引用

@article{arxiv.2307.06940,
  title  = {Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation},
  author = {Yingqing He and Menghan Xia and Haoxin Chen and Xiaodong Cun and Yuan Gong and Jinbo Xing and Yong Zhang and Xintao Wang and Chao Weng and Ying Shan and Qifeng Chen},
  journal= {arXiv preprint arXiv:2307.06940},
  year   = {2023}
}

备注

Github: https://github.com/VideoCrafter/Animate-A-Story Project page: https://videocrafter.github.io/Animate-A-Story