中文

SPRING:研读论文并推理以进行游戏

人工智能 2023-12-13 v3 机器学习

摘要

开放世界生存游戏因其多任务、深度探索与目标优先级排序需求,对 AI 算法提出了重大挑战。尽管强化学习(RL)常用于求解游戏,但其高样本复杂度限制了它在如 Crafter 或 Minecraft 这类复杂开放世界游戏中的有效性。我们提出一种新方法 SPRING,通过阅读游戏原始的学术论文,并利用所学到的知识,借助大语言模型(LLM)进行推理与游戏。以 LaTeX 源码作为游戏上下文并辅以智能体当前观测的描述作为提示,我们的 SPRING 框架采用以游戏相关问题为节点、依赖关系为边的有向无环图(DAG)。我们通过遍历该 DAG 并按拓扑顺序计算每个节点的 LLM 响应,确定在环境中应采取的最优动作,其中 LLM 对最终节点的回答直接转化为环境动作。在我们的实验中,我们在 Crafter 开放世界环境下研究了由不同形式提示所诱导的上下文内“推理”质量。我们的实验表明,当以一致的思维链提示时,LLM 在完成复杂高层轨迹方面具有巨大潜力。在定量上,使用 GPT-4 的 SPRING 无需任何训练即优于所有训练了 1M 步的当前最优 RL 基线。最后,我们展示了游戏作为 LLM 测试平台的潜力。

关键词

引用

@article{arxiv.2305.15486,
  title  = {SPRING: Studying the Paper and Reasoning to Play Games},
  author = {Yue Wu and Shrimai Prabhumoye and So Yeon Min and Yonatan Bisk and Ruslan Salakhutdinov and Amos Azaria and Tom Mitchell and Yuanzhi Li},
  journal= {arXiv preprint arXiv:2305.15486},
  year   = {2023}
}