中文

WorldGym:作为策略评估环境的世界模型

机器人学 2025-10-01 v3 人工智能

摘要

评估机器人控制策略十分困难:真实世界测试成本高昂,而手工制作的模拟器需要耗费人工来提升其真实性和泛化性。我们提出了一种基于世界模型的策略评估环境,这是一个自回归的、动作条件的视频生成模型,可作为真实世界环境的代理。策略通过世界模型中的蒙特卡洛展开进行评估,并由视觉-语言模型提供奖励。我们仅使用真实机器人的初始帧,在世界模型中评估了一组基于 VLA 的真实机器人策略,并表明世界模型内的策略成功率与真实世界成功率高度相关。此外,我们表明 WorldGym 能够在不同策略版本、规模和训练检查点之间保持相对策略排名。由于仅需单一起始帧作为输入,世界模型进一步实现了对机器人策略在新任务和新环境上泛化能力的高效评估。我们发现,现代基于 VLA 的机器人策略仍然难以区分物体形状,并且容易被物体的对抗性外观所干扰。尽管生成高度真实的物体交互仍然具有挑战性,但 WorldGym 忠实地模拟了机器人运动,并为部署前安全且可复现的策略评估提供了一个实用的起点。

关键词

引用

@article{arxiv.2506.00613,
  title  = {WorldGym: World Model as An Environment for Policy Evaluation},
  author = {Julian Quevedo and Ansh Kumar Sharma and Yixiang Sun and Varad Suryavanshi and Percy Liang and Sherry Yang},
  journal= {arXiv preprint arXiv:2506.00613},
  year   = {2025}
}

备注

https://world-model-eval.github.io