MovieFactory:利用大型语言与图像生成模型从文本自动生成电影
计算机视觉与模式识别
2023-06-13 v1
摘要
在本文中,我们提出 MovieFactory,一个强大的框架,可根据自然语言需求生成电影级画面(30721280)、电影风格(多场景)和多模态(带声音)的电影。据我们所知,作为首个全自动电影生成模型,我们的方法使用简单文本输入即可让用户创建具有平滑过渡的引人入胜的电影,超越了现有生成限于单场景中等质量无声视频的方法。为支持这一独特功能,我们利用 ChatGPT 将用户提供的文本扩展为用于电影生成的详细顺序脚本。然后我们通过视觉生成和音频检索将脚本在视觉和听觉上变为现实。为生成视频,我们通过两阶段过程扩展预训练文本到图像扩散模型的能力。首先,我们采用空间微调来弥合预训练图像模型与新视频数据集间的差距。随后,我们引入时间学习来捕捉物体运动。在音频方面,我们利用精细的检索模型来选择并与电影情节和视觉内容对齐的音频元素。大量实验表明,我们的 MovieFactory 生成具有逼真视觉、多样场景和无缝契合音频的电影,为用户提供新颖且沉浸式的体验。生成样本可在 YouTube 或 Bilibili(1080P)查看。
引用
@article{arxiv.2306.07257,
title = {MovieFactory: Automatic Movie Creation from Text using Large Generative Models for Language and Images},
author = {Junchen Zhu and Huan Yang and Huiguo He and Wenjing Wang and Zixi Tuo and Wen-Huang Cheng and Lianli Gao and Jingkuan Song and Jianlong Fu},
journal= {arXiv preprint arXiv:2306.07257},
year = {2023}
}