AI 商店:基于人类游戏评估机器通用智能的可扩展、开放式方法
人工智能
2026-02-20 v1
摘要
在快速技术进步的时代,严格评估机器智能与广泛的人类通用智能之间的关系变得越来越重要且具有挑战性。传统的 AI 基准测试通常仅评估有限范围人类活动中的狭义能力。大多数基准测试也是静态的,随着开发人员显式或隐式地针对它们进行优化,迅速饱和。我们提出,通过一种尤其强大的通用游戏玩法来评估人类式通用智能:研究它们如何以及如何良好地学习和玩遍所有可能的人类游戏,同时将其与在相同经验、时间或其他资源条件下的人类玩家进行比较。我们将“人类游戏”定义为由人类为人类设计的游戏,主张这种由人类可以想象并享受的所有游戏构成的“人类游戏宇宙”具有评估适用性。作为实现这一愿景的第一步,我们引入了 AI 商店,这是一个可扩展且开放式的平台,使用带有人类在环(Loop)的大语言模型(LLM),合成新的代表性人类游戏,自动从流行的人类数字游戏平台中源头并调整标准化且容器化的游戏环境变体。作为一种概念验证,我们基于 Apple App Store 和 Steam 的热门排行榜生成了 100 个此类游戏,并在短暂游戏回合中对七个前沿视觉-语言模型(VLM)进行评估。最佳模型在大多数游戏中的平均水平得分不到 10%,尤其在挑战世界模型学习、记忆和规划的游戏中表现困难。我们随后提出了一系列下一步措施,以将 AI 商店构建为衡量和推动机器向人类式通用智能进程的实用方法。
引用
@article{arxiv.2602.17594,
title = {AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games},
author = {Lance Ying and Ryan Truong and Prafull Sharma and Kaiya Ivy Zhao and Nathan Cloos and Kelsey R. Allen and Thomas L. Griffiths and Katherine M. Collins and José Hernández-Orallo and Phillip Isola and Samuel J. Gershman and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:2602.17594},
year = {2026}
}
备注
29 pages, 14 figures