MagicVideo-V2:多阶段高美学视频生成
计算机视觉与模式识别
2024-01-10 v1 人工智能
摘要
对从文本描述生成高保真视频日益增长的需求推动了该领域的重大研究。在本工作中,我们推出了 MagicVideo-V2,它将文本到图像模型、视频运动生成器、参考图像嵌入模块和帧插值模块集成到一个端到端的视频生成流水线中。得益于这些架构设计,MagicVideo-V2 能够生成具有卓越保真度和流畅度的高分辨率美学视频。通过大规模用户评估,它展示了优于 Runway、Pika 1.0、Morph、Moon Valley 和 Stable Video Diffusion 模型等领先文本到视频系统的性能。
引用
@article{arxiv.2401.04468,
title = {MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation},
author = {Weimin Wang and Jiawei Liu and Zhijie Lin and Jiangqiao Yan and Shuo Chen and Chetwin Low and Tuyen Hoang and Jie Wu and Jun Hao Liew and Hanshu Yan and Daquan Zhou and Jiashi Feng},
journal= {arXiv preprint arXiv:2401.04468},
year = {2024}
}