WorldPrediction:面向高层世界建模与长期程序规划的基准
计算机视觉与模式识别
2025-06-06 v1
摘要
人类被认为拥有内部的“世界模型”,使我们能够基于世界状态进行动作规划。AI智能体也需要具备此类世界模型以进行动作规划。目前尚不清楚的是,尤其是生成模型,如何学习到此类世界模型并能在多样化环境中执行程序规划。我们引入WorldPrediction,一个基于视频的基准,用于评估不同AI模型的世界建模和程序规划能力。与先前聚焦于低层世界建模和机器人运动规划的基准不同,WorldPrediction是第一个强调具有时序和语义抽象性的动作的基准。给定初始和最终世界状态,任务是从一组反事实干扰项中区分出正确的动作(WorldPrediction-WM)或正确排序的动作序列(WorldPrediction-PP)。这种判别性任务设置使我们能够评估不同类型的世界模型和规划器,并实现对不同假设的全面比较。该基准使用视觉观察来表示状态和动作。为防止模型利用背景场景中低级连续性线索,我们提供“动作等价项”——即在不同上下文中观察到的相同动作——作为选择项。该基准建立在部分可观测半马尔可夫决策过程(partially observable semi-MDP)的正式框架中,确保其评估的可靠性和鲁棒性。我们对基准进行了大规模的人类筛选和验证,显示当前前沿模型在WorldPrediction-WM上仅能达到57%的准确率,在WorldPrediction-PP上仅能达到38%准确率,而人类能够完美解决这两个任务。
引用
@article{arxiv.2506.04363,
title = {WorldPrediction: A Benchmark for High-level World Modeling and Long-horizon Procedural Planning},
author = {Delong Chen and Willy Chung and Yejin Bang and Ziwei Ji and Pascale Fung},
journal= {arXiv preprint arXiv:2506.04363},
year = {2025}
}