PokerBench:训练大型语言模型成为专业扑克玩家
计算与语言
2025-01-28 v2 人工智能
计算机科学与博弈论
摘要
我们提出PokerBench——一个用于评估大型语言模型(LLM)扑克-playing能力的基准测试。由于大型语言模型在传统NLP任务中表现出色,其应用于像扑克这样的复杂战略游戏,构成了新的挑战。扑克是一种不完全信息游戏,要求具备数学、推理、规划、策略以及对游戏理论和人类心理学的深入理解。这使得扑克成为大型语言模型下一个理想的前沿。PokerBench包括11,000个最重要情景的全面编译,分为翻前和翻后阶段,由经过训练的扑克玩家合作开发。我们评估了包括GPT-4、ChatGPT 3.5以及各种Llama和Gemma系列模型在内的主流模型,发现所有最先进的大型语言模型在进行最优扑克游戏方面表现不佳。然而,在微调后,这些模型显示出显著的改进。我们通过让得分不同的模型相互对战来验证PokerBench,证明PokerBench的得分越高,在实际扑克游戏中赢率也越高。通过我们的微调模型与GPT-4的对战,我们还识别了简单监督式微调学习最优游戏策略的局限性,表明需要更先进的方法来有效地训练语言模型在游戏中取得优势。因此,PokerBench为快速可靠地评估大型语言模型的扑克-playing能力,以及为研究大型语言模型在复杂游戏情景中的进展提供了全面的基准测试。
引用
@article{arxiv.2501.08328,
title = {PokerBench: Training Large Language Models to become Professional Poker Players},
author = {Richard Zhuang and Akshat Gupta and Richard Yang and Aniket Rahane and Zhengyu Li and Gopala Anumanchipalli},
journal= {arXiv preprint arXiv:2501.08328},
year = {2025}
}
备注
AAAI 2025