VideoDirectorGPT:基于 LLM 引导规划的连贯多场景视频生成
计算机视觉与模式识别
2024-07-16 v2 人工智能
计算与语言
机器学习
摘要
近期的文本到视频(T2V)生成方法取得了显著进展。然而,这些工作大多聚焦于生成单一事件的短视频片段(即单场景视频)。与此同时,近期的大语言模型(LLMs)已展示出生成布局与程序以控制下游视觉模块的能力。这引出一个重要问题:我们能否利用这些 LLM 中嵌入的知识来实现时间连贯的长视频生成?本文中,我们提出 VideoDirectorGPT,一种新颖的连贯多场景视频生成框架,它利用 LLM 的知识进行视频内容规划与接地视频生成。具体而言,给定单一文本提示,我们首先让视频规划 LLM(GPT-4)将其扩展为一份“视频计划”,其中包含场景描述、各实体及其布局、每场景的背景,以及实体的连贯性分组。接下来,在该视频计划引导下,我们的视频生成器 Layout2Vid 对空间布局具有显式控制,并能维持实体跨多场景的时间一致性,同时仅以图像级标注进行训练。我们的实验表明,所提 VideoDirectorGPT 框架在单场景与多场景视频生成中均大幅改善了布局与运动控制,并能生成连贯的多场景视频,同时在开放域单场景 T2V 生成中与 SOTA 取得有竞争力的表现。详细的消融研究,包括用 LLM 动态调整布局控制强度以及利用用户提供的图像进行视频生成,证实了框架各组件的有效性及其未来潜力。
引用
@article{arxiv.2309.15091,
title = {VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning},
author = {Han Lin and Abhay Zala and Jaemin Cho and Mohit Bansal},
journal= {arXiv preprint arXiv:2309.15091},
year = {2024}
}
备注
COLM 2024; Project page: https://videodirectorgpt.github.io