中文

LLaMA Rider:激发大语言模型探索开放世界

机器学习 2023-10-16 v1

摘要

近来,各类研究利用大语言模型(LLMs)辅助环境中的决策与规划,并试图将 LLM 的知识与世界状态对齐。然而,LLM 在开放世界中持续获取环境知识并适应的能力仍不确定。本文中,我们提出一种激发 LLM 探索开放世界、收集经验并学习提升其任务解决能力的方法。该方法利用多轮反馈—修正机制,鼓励 LLM 在环境反馈信息引导下主动选取恰当修正动作。这促进了探索并提升了模型表现。此外,我们整合子任务重标号,协助 LLM 保持子任务规划的一致性,并帮助模型学习任务间的组合性质,使其能通过基于所获探索经验的训练完成更广范围的任务。通过在开放沙盒世界 Minecraft 中的评估,我们证明我们的方法 LLaMA-Rider 提升了 LLM 探索环境的效率,并仅用收集的 1.3k 实例数据微调便有效改善 LLM 完成更多任务的能力,相较使用强化学习的基线显示出极小训练成本。

关键词

引用

@article{arxiv.2310.08922,
  title  = {LLaMA Rider: Spurring Large Language Models to Explore the Open World},
  author = {Yicheng Feng and Yuxuan Wang and Jiazheng Liu and Sipeng Zheng and Zongqing Lu},
  journal= {arXiv preprint arXiv:2310.08922},
  year   = {2023}
}

备注

18 pages