Mind's Eye:基于仿真的具身语言模型推理
计算与语言
2022-10-12 v1 人工智能
摘要
人类与 AI 之间成功且有效的沟通依赖于对世界的共享经验。仅通过文本训练,当前的语言模型(LMs)缺失了人类在真实世界中的具身经验——它们无法将语言与物理世界联系起来,导致知识被错误表征并在推理中出现明显错误。我们提出了 Mind's Eye,一种将语言模型推理扎根于物理世界的范式。给定一个物理推理问题,我们使用计算物理引擎(DeepMind 的 MuJoCo)来模拟可能的结果,然后将仿真结果作为输入的一部分,使语言模型能够执行推理。在物理对齐基准测试的 39 个任务上的实验表明,Mind's Eye 能够大幅提升推理能力(平均绝对准确率提升 27.9% 的 zero-shot 和 46.0% 的 few-shot)。配备了 Mind's Eye 的较小语言模型可以获得与 100 倍大模型相似的性能。最后,我们通过消融实验验证了 Mind's Eye 的鲁棒性。
引用
@article{arxiv.2210.05359,
title = {Mind's Eye: Grounded Language Model Reasoning through Simulation},
author = {Ruibo Liu and Jason Wei and Shixiang Shane Gu and Te-Yen Wu and Soroush Vosoughi and Claire Cui and Denny Zhou and Andrew M. Dai},
journal= {arXiv preprint arXiv:2210.05359},
year = {2022}
}