中文

大型语言模型能玩游戏吗?一种自博弈方法的案例研究

人工智能 2024-03-12 v1

摘要

大型语言模型 (LLMs) 利用来自互联网的大量数据,存储了广泛的先验知识。虽然 LLMs 已被证明作为决策辅助工具是有益的,但其可靠性受到推理局限性、幻觉现象等的阻碍。另一方面,蒙特卡洛树搜索 (MCTS) 是一种启发式搜索算法,通过递归展开和自博弈提供可靠的决策解决方案。然而,MCTS 的有效性严重依赖于启发式剪枝和外部价值函数,特别是在复杂的决策场景中。这项工作引入了一种创新方法,通过 MCTS 自博弈增强 LLMs,以高效解决确定性回合制零和游戏 (DTZG),如国际象棋和围棋,而无需额外的训练。具体而言,我们利用 LLMs 作为动作剪枝器和价值函数的代理,无需额外训练。我们从理论上证明,我们提出的方法中估计值的次优性随 O~(A~N+ϵpruner+ϵcritic)\tilde{\mathcal O}\Bigl(\frac{|\tilde {\mathcal A}|}{\sqrt{N}} + \epsilon_\mathrm{pruner} + \epsilon_\mathrm{critic}\Bigr) 缩放,其中 NN 是模拟次数,A~|\tilde {\mathcal A}| 是 LLM 剪枝后的动作空间基数,ϵpruner\epsilon_\mathrm{pruner}ϵcritic\epsilon_\mathrm{critic} 分别量化了采用 LLMs 作为动作空间剪枝器和价值函数代理所产生的误差。我们在国际象棋和围棋上的实验表明,我们的方法能够解决超出 MCTS 范围的挑战,并提高直接应用 LLMs 的性能。

关键词

引用

@article{arxiv.2403.05632,
  title  = {Can Large Language Models Play Games? A Case Study of A Self-Play Approach},
  author = {Hongyi Guo and Zhihan Liu and Yufeng Zhang and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2403.05632},
  year   = {2024}
}