中文

作为物理推理智能度量的 Phy-Q

人工智能 2023-01-30 v3 机器学习

摘要

人类善于推理物理对象的行为并据此选择动作以完成任务,而这仍是 AI 面临的一大挑战。为促进解决该问题的研究,我们提出一个新的测试平台,要求智能体对物理场景进行推理并采取恰当动作。受婴儿期习得的物理知识以及机器人在真实环境中运行所需能力启发,我们识别出 15 种基本物理场景。我们创建了多种多样的任务模板,并确保同一场景内的所有任务模板均可使用一条特定的策略性物理规则求解。借助这样的设计,我们评估了两种不同层次的泛化,即局部泛化与广泛泛化。我们对人类玩家、具有不同输入类型与架构的学习智能体以及具有不同策略的启发式智能体进行了广泛评估。受人类 IQ 计算方式启发,我们定义了物理推理商(Phy-Q 分数),以利用我们所考虑的物理场景反映智能体的物理推理智能。我们的评估表明:1)所有智能体都远不及人类表现;2)学习智能体即便具备良好的局部泛化能力,也难以学到潜在的物理推理规则并无法广泛泛化。我们鼓励开发能达到人类水平 Phy-Q 分数的智能体。网站:https://github.com/phy-q/benchmark

关键词

引用

@article{arxiv.2108.13696,
  title  = {Phy-Q as a measure for physical reasoning intelligence},
  author = {Cheng Xue and Vimukthini Pinto and Chathura Gamage and Ekaterina Nikonova and Peng Zhang and Jochen Renz},
  journal= {arXiv preprint arXiv:2108.13696},
  year   = {2023}
}

备注

For the associated website, see https://github.com/phy-q/benchmark