中文

Emu Video:通过显式图像条件分解文本到视频生成

计算机视觉与模式识别 2024-08-06 v2 人工智能 图形学 机器学习 多媒体

摘要

我们提出 Emu Video,一种文本到视频生成模型,该模型将生成分解为两步:首先生成以文本为条件的图像,然后生成以文本和所生成图像为条件的视频。我们确定了关键的设计决策——针对扩散的调整噪声调度,以及多阶段训练——使我们能够直接生成高质量和高分辨率视频,而无需像先前工作那样需要深度级联的模型。在人类评估中,我们生成的视频在质量上相较所有先前工作都被强烈偏好——81% 对 Google 的 Imagen Video,90% 对 Nvidia 的 PYOCO,以及 96% 对 Meta 的 Make-A-Video。我们的模型优于 RunwayML 的 Gen2 和 Pika Labs 等商业解决方案。最后,我们的分解方法自然适用于基于用户文本提示对图像进行动画化,其中我们的生成结果相较先前工作有 96% 被偏好。

关键词

引用

@article{arxiv.2311.10709,
  title  = {Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning},
  author = {Rohit Girdhar and Mannat Singh and Andrew Brown and Quentin Duval and Samaneh Azadi and Sai Saketh Rambhatla and Akbar Shah and Xi Yin and Devi Parikh and Ishan Misra},
  journal= {arXiv preprint arXiv:2311.10709},
  year   = {2024}
}

备注

ECCV 2024. Project page: https://emu-video.metademolab.com