视频生成的黎明:基于SORA类模型的初步探索
计算机视觉与模式识别
2024-10-11 v2
摘要
高质量视频生成,包括文本到视频(T2V)、图像到视频(I2V)和视频到视频(V2V)生成,对于内容创作具有重大意义,既能帮助每个人以新方式表达内在创造力,又能用于世界模拟与建模理解世界。像SORA这样的模型已实现更高分辨率、更自然的运动、更好的视觉语言对齐以及更高的可控性,尤其是针对长视频序列。这些改进推动了模型架构的演进,从UNet转向更可扩展、参数更丰富的DiT模型,同时伴随大规模数据扩张和训练策略的细化。然而,尽管DiT基于的闭源和开源模型不断涌现,针对其能力与局限性的综合调查仍缺乏。此外,快速的发展使得最近的基准测试难以充分覆盖SORA类模型,难以认识到其显著性进步。此外,评估指标往往无法与人类偏好相匹配。
引用
@article{arxiv.2410.05227,
title = {The Dawn of Video Generation: Preliminary Explorations with SORA-like Models},
author = {Ailing Zeng and Yuhang Yang and Weidong Chen and Wei Liu},
journal= {arXiv preprint arXiv:2410.05227},
year = {2024}
}
备注
project: https://ailab-cvc.github.io/VideoGen-Eval/