WorldMark:用于交互式视频世界模型的统一基准套件
计算机视觉与模式识别
2026-04-24 v1
摘要
交互式视频生成模型(如Genie、YUME、HY-World、Matrix-Game)正快速发展,但每个模型都在私有场景和轨迹上进行评估,导致无法进行公平的跨模型比较。现有公开基准提供轨迹误差、审美评分和基于VLM的判断等有用指标,但缺乏统一的测试条件——相同的场景、相同的动作序列和统一的控制界面——以实现跨模型异构输入下的可比性。我们引入WorldMark,首个为交互式图像到视频世界模型提供统一比赛场地的基准。WorldMark贡献包括:(1)统一的动作映射层,将共享的WASD式动作词汇ary into each model's native control format,实现跨六大模型在相同场景和轨迹上的公平比较;(2)覆盖第一人称和第三人称视角、写实场景和手绘风景场景,并分为易到难三个难度等级(覆盖20-60秒)的500个评估案例的层次化测试套件;(3)用于视觉质量、控制对齐和世界一致性的模块化评估工具包,旨在让研究人员能够复用我们的标准化输入,同时插拔式地使用自身的指标以适应学科演进。我们将发布所有数据、评估代码和模型输出,以促进未来研究。除离线指标外,我们推出World Model Arena(warena.ai),在线平台允许任何人将领先世界模型进行一对一对战,并查看实时排行榜。
引用
@article{arxiv.2604.21686,
title = {WorldMark: A Unified Benchmark Suite for Interactive Video World Models},
author = {Xiaojie Xu and Zhengyuan Lin and Kang He and Yukang Feng and Xiaofeng Mao and Yuanyang Yin and Kaipeng Zhang and Yongtao Ge},
journal= {arXiv preprint arXiv:2604.21686},
year = {2026}
}