中文

VideoVerse:你的文本到视频生成模型是否具备世界模型能力以合成视频?

计算机视觉与模式识别 2026-05-18 v4

摘要

最近文本到视频(T2V)生成技术的快速进步正在让训练有素的模型具备更多世界模型能力,而现有基准测试日益不足以评估最先进的T2V模型。首先,当前的评估维度,如每帧审美质量和时间一致性,已无法区分最先进的T2V模型。其次,事件级时间因果性——这是区别于其他模态的关键属性——仍基本未被探索。第三,现有基准测试缺乏对世界知识的系统性评估,而这正是构建世界模型所必需的能力。为此,我们引入VideoVerse,一个综合性基准,聚焦于评估当前T2V模型是否理解复杂的时间因果性和世界知识以合成视频。我们收集代表性视频,跨越多个领域,并提取其内在时间因果性的事件级描述,再由独立标注员重写为文本到视频提示。对于每个提示,我们设计十个评估维度,覆盖动态和静态属性,最终得到300个提示、815个事件和793个评估问题。Consequently,我们开发了一个基于现代视觉语言模型的人类偏好对齐的基于QA的评估管道,系统性地对领先的开放式和封闭式T2V系统进行基准测试,揭示了当前T2V模型与所需世界建模能力之间的差距。

关键词

引用

@article{arxiv.2510.08398,
  title  = {VideoVerse: Does Your T2V Generator Have World Model Capability to Synthesize Videos?},
  author = {Zeqing Wang and Xinyu Wei and Bairui Li and Zhen Guo and Jinrui Zhang and Hongyang Wei and Keze Wang and Lei Zhang},
  journal= {arXiv preprint arXiv:2510.08398},
  year   = {2026}
}

备注

26 Pages, 10 Figures, 14 Tables