中文

Vlogger:让梦想成为视频博客

计算机视觉与模式识别 2024-01-18 v1 人工智能 机器学习 多媒体

摘要

在这项工作中,我们提出了 Vlogger,一个用于根据用户描述生成分钟级视频博客(即 vlog)的通用 AI 系统。与仅几秒的短视频不同,vlog 通常包含复杂的故事线和多样化的场景,这对大多数现有的视频生成方法来说是一个挑战。为了突破这一瓶颈,我们的 Vlogger 巧妙地利用大语言模型(LLM)作为导演,将 vlog 的长视频生成任务分解为四个关键阶段,在此过程中调用各种基础模型来扮演 vlog 专业人士的关键角色,包括 (1) 编剧、(2) 演员、(3) 制片人和 (4) 配音员。通过这种模仿人类的设计,我们的 Vlogger 能够通过自上而下的规划与自下而上的拍摄之间的可解释性协作来生成 vlog。此外,我们引入了一种新颖的视频扩散模型 ShowMaker,它在我们的 Vlogger 中担任摄影师,负责生成每个拍摄场景的视频片段。通过细致地将剧本和演员作为文本和视觉提示纳入其中,它可以有效地增强片段中的时空一致性。此外,我们为 ShowMaker 设计了一种简洁的混合训练范式,提升了其在 T2V 生成和预测任务上的能力。最后,大量实验表明,我们的方法在零样本 T2V 生成和预测任务上达到了最先进(SOTA)的性能。更重要的是,Vlogger 能够根据开放世界描述生成超过 5 分钟的 vlog,且在剧本和演员方面不损失视频连贯性。代码和模型可在 https://github.com/zhuangshaobin/Vlogger 获取。

关键词

引用

@article{arxiv.2401.09414,
  title  = {Vlogger: Make Your Dream A Vlog},
  author = {Shaobin Zhuang and Kunchang Li and Xinyuan Chen and Yaohui Wang and Ziwei Liu and Yu Qiao and Yali Wang},
  journal= {arXiv preprint arXiv:2401.09414},
  year   = {2024}
}

备注

16 pages, 8 figures, 11 tables