中文

Strategist: 通过双层树搜索实现LLM决策的自我提升

人工智能 2025-07-30 v3 计算与语言

摘要

传统的强化学习和规划通常需要大量的数据和训练来开发有效的策略。相比之下,大语言模型(LLM)表现出强大的泛化能力和零样本能力,但在需要详细规划和复杂动作空间中决策的任务上存在困难。我们引入了STRATEGIST,一种结合两种方法优势的新方法。我们的方法利用LLM搜索和更新高级策略(以文本形式),然后由低层蒙特卡洛树搜索(MCTS)进行细化和执行。STRATEGIST是一个可泛化的框架,通过基于群体的自对弈模拟来优化策略,无需任何训练数据。我们证明了STRATEGIST在学习竞争性多回合博弈和部分信息博弈的最优策略方面的有效性,包括纯策略博弈(GOPS)和多智能体、隐藏身份的讨论博弈如The Resistance: Avalon。我们的结果表明,配备STRATEGIST的智能体在两种游戏环境中均优于使用传统RL方法训练的智能体、其他基于LLM的技能获取技术以及预先存在的LLM智能体,并且达到了与人类玩家相当的性能。

关键词

引用

@article{arxiv.2408.10635,
  title  = {Strategist: Self-improvement of LLM Decision Making via Bi-Level Tree Search},
  author = {Jonathan Light and Min Cai and Weiqin Chen and Guanzhi Wang and Xiusi Chen and Wei Cheng and Yisong Yue and Ziniu Hu},
  journal= {arXiv preprint arXiv:2408.10635},
  year   = {2025}
}

备注

website: https://llm-strategist.github.io