VideoVerse:你的文本到视频生成模型是否具备世界模型能力以合成视频?
计算机视觉与模式识别
2026-05-18 v4
摘要
最近文本到视频(T2V)生成技术的快速进步正在让训练有素的模型具备更多世界模型能力,而现有基准测试日益不足以评估最先进的T2V模型。首先,当前的评估维度,如每帧审美质量和时间一致性,已无法区分最先进的T2V模型。其次,事件级时间因果性——这是区别于其他模态的关键属性——仍基本未被探索。第三,现有基准测试缺乏对世界知识的系统性评估,而这正是构建世界模型所必需的能力。为此,我们引入VideoVerse,一个综合性基准,聚焦于评估当前T2V模型是否理解复杂的时间因果性和世界知识以合成视频。我们收集代表性视频,跨越多个领域,并提取其内在时间因果性的事件级描述,再由独立标注员重写为文本到视频提示。对于每个提示,我们设计十个评估维度,覆盖动态和静态属性,最终得到300个提示、815个事件和793个评估问题。Consequently,我们开发了一个基于现代视觉语言模型的人类偏好对齐的基于QA的评估管道,系统性地对领先的开放式和封闭式T2V系统进行基准测试,揭示了当前T2V模型与所需世界建模能力之间的差距。
引用
@article{arxiv.2510.08398,
title = {VideoVerse: Does Your T2V Generator Have World Model Capability to Synthesize Videos?},
author = {Zeqing Wang and Xinyu Wei and Bairui Li and Zhen Guo and Jinrui Zhang and Hongyang Wei and Keze Wang and Lei Zhang},
journal= {arXiv preprint arXiv:2510.08398},
year = {2026}
}
备注
26 Pages, 10 Figures, 14 Tables