中文

FlowZero:基于 LLM 驱动动态场景语法的零样本文本到视频合成

计算机视觉与模式识别 2023-11-28 v1 人工智能

摘要

文本到视频(T2V)生成是一个快速发展的研究领域,旨在将复杂视频文本中的场景、对象和动作转化为连贯的视觉帧序列。我们提出 FlowZero,一种结合大语言模型(LLM)与图像扩散模型以生成时间连贯视频的新框架。FlowZero 利用 LLM 从文本中理解复杂的时空动态,其中 LLM 可生成包含场景描述、对象布局和背景运动模式的综合动态场景语法(DSS)。DSS 中的这些元素随后用于引导图像扩散模型生成具有平滑对象运动与帧间一致性的视频。此外,FlowZero 引入了迭代自精炼过程,增强了时空布局与视频文本提示之间的对齐。为增强全局一致性,我们提出以运动动态丰富每帧的初始噪声,以自适应地控制背景移动与相机运动。通过利用时空语法引导扩散过程,FlowZero 在零样本视频合成上取得提升,生成具有生动运动的连贯视频。

关键词

引用

@article{arxiv.2311.15813,
  title  = {FlowZero: Zero-Shot Text-to-Video Synthesis with LLM-Driven Dynamic Scene Syntax},
  author = {Yu Lu and Linchao Zhu and Hehe Fan and Yi Yang},
  journal= {arXiv preprint arXiv:2311.15813},
  year   = {2023}
}

备注

Project page: https://flowzero-video.github.io