中文

VideoCrafter1:用于高质量视频生成的开放扩散模型

计算机视觉与模式识别 2023-10-31 v1

摘要

视频生成在学术界和工业界日益受到关注。尽管商业工具能生成看似合理的视频,但可供研究人员和工程师使用的开源模型数量有限。在本工作中,我们引入两个用于高质量视频生成的扩散模型,即文本到视频(T2V)和图像到视频(I2V)模型。T2V模型基于给定文本输入合成视频,而I2V模型额外引入图像输入。我们提出的T2V模型能以1024×5761024 \times 576分辨率生成逼真且具电影质感的视频,在质量上优于其他开源T2V模型。I2V模型旨在生成严格遵循所给参考图像内容、保留其内容、结构与风格的视频。该模型是首个能够在保持内容保留约束的同时将给定图像转换为视频片段的开源I2V基础模型。我们相信这些开源视频生成模型将显著推动社区内的技术进展。

关键词

引用

@article{arxiv.2310.19512,
  title  = {VideoCrafter1: Open Diffusion Models for High-Quality Video Generation},
  author = {Haoxin Chen and Menghan Xia and Yingqing He and Yong Zhang and Xiaodong Cun and Shaoshu Yang and Jinbo Xing and Yaofang Liu and Qifeng Chen and Xintao Wang and Chao Weng and Ying Shan},
  journal= {arXiv preprint arXiv:2310.19512},
  year   = {2023}
}

备注

Tech Report; Github: https://github.com/AILab-CVC/VideoCrafter Homepage: https://ailab-cvc.github.io/videocrafter/