大型语言模型能玩游戏吗?一种自博弈方法的案例研究
人工智能
2024-03-12 v1
摘要
大型语言模型 (LLMs) 利用来自互联网的大量数据,存储了广泛的先验知识。虽然 LLMs 已被证明作为决策辅助工具是有益的,但其可靠性受到推理局限性、幻觉现象等的阻碍。另一方面,蒙特卡洛树搜索 (MCTS) 是一种启发式搜索算法,通过递归展开和自博弈提供可靠的决策解决方案。然而,MCTS 的有效性严重依赖于启发式剪枝和外部价值函数,特别是在复杂的决策场景中。这项工作引入了一种创新方法,通过 MCTS 自博弈增强 LLMs,以高效解决确定性回合制零和游戏 (DTZG),如国际象棋和围棋,而无需额外的训练。具体而言,我们利用 LLMs 作为动作剪枝器和价值函数的代理,无需额外训练。我们从理论上证明,我们提出的方法中估计值的次优性随 缩放,其中 是模拟次数, 是 LLM 剪枝后的动作空间基数, 和 分别量化了采用 LLMs 作为动作空间剪枝器和价值函数代理所产生的误差。我们在国际象棋和围棋上的实验表明,我们的方法能够解决超出 MCTS 范围的挑战,并提高直接应用 LLMs 的性能。
引用
@article{arxiv.2403.05632,
title = {Can Large Language Models Play Games? A Case Study of A Self-Play Approach},
author = {Hongyi Guo and Zhihan Liu and Yufeng Zhang and Zhaoran Wang},
journal= {arXiv preprint arXiv:2403.05632},
year = {2024}
}