具身智能体是否会梦到像素化的羊:基于语言引导世界建模的具身决策
机器学习
2023-04-28 v2 计算与语言
摘要
强化学习(RL)智能体通常从零开始(tabula rasa)学习,没有关于世界的先验知识。然而,如果以高层子目标及子目标间转移的知识进行初始化,RL 智能体便可利用此抽象世界模型(AWM)进行规划与探索。我们提出使用少样本大语言模型(LLMs)来假设一个 AWM,该模型将通过世界经验进行验证,以提高 RL 智能体的样本效率。我们的 DECKARD 智能体在 Minecraft 的物品合成中分两阶段应用 LLM 引导的探索:(1)梦境阶段,智能体使用 LLM 将任务分解为子目标序列,即假设的 AWM;(2)清醒阶段,智能体为每个子目标学习模块化策略,并验证或修正假设的 AWM。我们利用 LLM 假设 AWM 并基于智能体经验验证 AWM 的方法,不仅使样本效率相较当代方法提高一个数量级,而且对环境动态中来自 LLM 的含噪互联网规模信息具有鲁棒性并能纠正其错误,成功将二者与 grounded 的环境动力学知识相融合。
引用
@article{arxiv.2301.12050,
title = {Do Embodied Agents Dream of Pixelated Sheep: Embodied Decision Making using Language Guided World Modelling},
author = {Kolby Nottingham and Prithviraj Ammanabrolu and Alane Suhr and Yejin Choi and Hannaneh Hajishirzi and Sameer Singh and Roy Fox},
journal= {arXiv preprint arXiv:2301.12050},
year = {2023}
}
备注
in proceedings of ICML 23