iWorld-Bench:具有统一动作生成框架的交互式世界模型基准
计算机视觉与模式识别
2026-05-07 v2 人工智能
摘要
实现通用人工智能 (AGI) 需要能够自适应学习与交互的智能体,而交互式世界模型为感知、推理和行动提供了可扩展的环境。然而,当前研究仍然缺乏大规模数据集和统一基准来评估其物理交互能力。为了解决这个问题,我们提出了 iWorld-Bench,这是一个用于在距离感知和记忆等交互相关能力上训练和测试世界模型的综合基准。我们构建了一个包含 33 万个视频片段的多样化数据集,并精选了 2.1k 个涵盖不同视角、天气和场景的高质量样本。由于现有世界模型在交互模态上存在差异,我们引入了动作生成框架以统一评估,并设计了六种任务类型,生成了 4.9k 个测试样本。这些任务共同评估了模型在视觉生成、轨迹跟随和记忆方面的表现。我们对 14 个具有代表性的世界模型进行了评估,识别了关键局限性并为未来研究提供了见解。iWorld-Bench 模型排行榜已在 iWorld-Bench.com 公开。
引用
@article{arxiv.2605.03941,
title = {iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework},
author = {Jianjie Fang and Yingshan Lei and Qin Wan and Ziyou Wang and Yuchao Huang and Yongyan Xu and Baining Zhao and Weichen Zhang and Chen Gao and Xinlei Chen and Yong Li},
journal= {arXiv preprint arXiv:2605.03941},
year = {2026}
}
备注
Accepted at ICML 2026