WALL-E: 通过规则学习改善基于世界模型的 LLM 代理
人工智能
2024-10-15 v2
摘要
大型语言模型(LLM)能否直接作为强大的世界模型用于模型驱动的代理?尽管 LLM 的先验知识与指定环境的动态之间存在差距,但我们的研究表明,通过与部署环境对齐,这些差距可以被桥接,且这种'世界对齐'可以通过 LLM 上的规则学习来高效实现。鉴于 LLM 的丰富先验知识,仅需少量额外规则即可实现 LLM 预测与指定环境动态的对齐。为此,我们提出一种神经符号方法,通过 LLM 实现规则的梯度-free 学习,基于代理探索轨迹与世界模型预测之间的比较来诱导、更新和修剪规则。最终得到的世界模型由 LLM 和所学规则组成。我们构建基于模型预测控制(MPC)的具身 LLM 代理'WALL-E'。通过精确的世界模型优化前瞻动作,MPC显著提高了探索和学习效率。与现有 LLM 代理相比,WALL-E 的推理仅需少量核心规则,无需将冗长的缓冲轨迹纳入 LLM 输入。在 Minecraft 和 ALFWorld 上,WALL-E 在成功率上超过基线15-30%,且在重规划次数上节省8-20次,仅需60-80%的 token。
引用
@article{arxiv.2410.07484,
title = {WALL-E: World Alignment by Rule Learning Improves World Model-based LLM Agents},
author = {Siyu Zhou and Tianyi Zhou and Yijun Yang and Guodong Long and Deheng Ye and Jing Jiang and Chengqi Zhang},
journal= {arXiv preprint arXiv:2410.07484},
year = {2024}
}
备注
35 pages, including references and appendix. Code is available at https://github.com/elated-sawyer/WALL-E