NEWTON:大语言模型是否具备物理推理能力?
计算与语言
2023-10-12 v1 人工智能
机器人学
摘要
大语言模型(LLMs)通过其上下文表示,已在经验上被证明蕴含句法、语义、词义和常识知识。然而,对其物理推理能力——特别是关于理解日常物体关键属性的能力——的探索有限。为弥补这一空白,我们引入NEWTON,一个用于评估LLMs物理推理技能的仓库与基准。此外,为使该基准能进行领域特定适配,我们提出一个流程,使研究者能够生成该基准的变体,定制为与其应用相关的物体和属性。NEWTON仓库包含2800个物体-属性对,为生成无限规模评估模板提供基础。NEWTON基准由160K问答问题组成,使用NEWTON仓库整理,以考察若干主流语言模型在基础、显式和隐式推理任务上的物理推理能力。通过广泛实证分析,我们的结果凸显了LLMs的物理推理能力。我们发现,如GPT-4之类的LLMs在基于场景的任务中表现出强推理能力,但在物体-属性推理上相比人类一致性较低(50%对84%)。此外,NEWTON平台展示了其在评估和改进语言模型方面的潜力,为将其集成到物理具身环境(如机器人操作)铺平道路。项目主页:https://newtonreasoning.github.io
引用
@article{arxiv.2310.07018,
title = {NEWTON: Are Large Language Models Capable of Physical Reasoning?},
author = {Yi Ru Wang and Jiafei Duan and Dieter Fox and Siddhartha Srinivasa},
journal= {arXiv preprint arXiv:2310.07018},
year = {2023}
}
备注
EMNLP 2023 Findings; 8 pages, 3 figures, 7 tables; Project page: https://newtonreasoning.github.io