中文

WorldArena:评估具身世界模型感知与功能实用性的统一基准

计算机视觉与模式识别 2026-02-12 v2 机器人学

摘要

尽管世界模型通过使智能体能够基于动作条件预测来推理环境动态,已成为具身智能的基石,但对其评估仍然是碎片化的。当前对具身世界模型的评估主要关注感知保真度(例如,视频生成质量),忽视了这些模型在下游决策任务中的功能实用性。在这项工作中,我们引入了WorldArena,一个统一的基准,旨在系统地评估具身世界模型在感知和功能两个维度上的表现。WorldArena通过三个维度评估模型:视频感知质量,使用跨越六个子维度的16个指标进行测量;具身任务功能性,评估世界模型作为数据引擎、策略评估器和行动规划器的能力,并结合主观人类评估。此外,我们提出了EWMScore,一个将多维性能整合为单一可解释指数的整体指标。通过对14个代表性模型进行广泛实验,我们揭示了一个显著的感知-功能差距,表明高视觉质量并不一定能转化为强大的具身任务能力。WorldArena基准及其公开排行榜已在https://world-arena.ai发布,为追踪具身AI中真正功能性世界模型的进展提供了一个框架。

关键词

引用

@article{arxiv.2602.08971,
  title  = {WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models},
  author = {Yu Shang and Zhuohang Li and Yiding Ma and Weikang Su and Xin Jin and Ziyou Wang and Lei Jin and Xin Zhang and Yinzhou Tang and Haisheng Su and Chen Gao and Wei Wu and Xihui Liu and Dhruv Shah and Zhaoxiang Zhang and Zhibo Chen and Jun Zhu and Yonghong Tian and Tat-Seng Chua and Wenwu Zhu and Yong Li},
  journal= {arXiv preprint arXiv:2602.08971},
  year   = {2026}
}