你的世界模拟器是好的故事讲述者吗?——面向未来长视频生成的连续事件基准
计算机视觉与模式识别
2024-12-24 v1 计算与语言
图形学
摘要
当前最先进的视频生成模型能够生成具有高度真实细节的视频。然而,它们仍然难以连贯地呈现提示词所指定的多个顺序事件。例如,顶尖的文本到视频(T2V)模型仍无法生成“如何将大象放入冰箱”这一简短故事的视频。虽然现有的基准测试主要关注美学质量、时空一致性等细节指标,但它们未能评估模型处理事件级故事呈现的能力。为弥补这一空白,我们引入了StoryEval,一个专门设计用于评估T2V模型故事完成能力的基准。StoryEval包含7类共423个提示词,每个提示词代表一个由2-4个连续事件组成的简短故事。我们采用先进的视觉语言模型(如GPT-4V和LLaVA-OV-Chat-72B)来验证生成视频中每个事件的完成情况,并应用多数投票方法以提高可靠性。我们的评估方法与人类评估高度一致,对11个模型的评估揭示了其挑战性,没有模型的平均故事完成率超过50%。StoryEval为推进T2V模型提供了一个新的基准,并凸显了开发用于连贯长视频生成的下一代解决方案所面临的挑战与机遇。
关键词
引用
@article{arxiv.2412.16211,
title = {Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation},
author = {Yiping Wang and Xuehai He and Kuan Wang and Luyao Ma and Jianwei Yang and Shuohang Wang and Simon Shaolei Du and Yelong Shen},
journal= {arXiv preprint arXiv:2412.16211},
year = {2024}
}
备注
benchmark paper, project page: https://ypwang61.github.io/project/StoryEval