PokerGPT:基于大语言模型的端到端轻量级多人德州扑克求解器
人工智能
2024-01-17 v1 计算与语言
摘要
扑克,又称德州扑克,一直是不完美信息博弈(IIG)中的典型研究对象。IIG 长期作为衡量人工智能(AI)发展的标尺。代表性的先前工作,如 DeepStack 和 Libratus,严重依赖反事实遗憾最小化(CFR)来解决两人无限注扑克。然而,由于 CFR 迭代的高昂计算成本,后续研究者难以从先前模型中学习 CFR 并将其应用于其他现实世界问题。此外,由于博弈树规模呈指数增长,CFR 难以应用于多人博弈。在本工作中,我们提出 PokerGPT,一个端到端求解器,可玩任意人数的德州扑克并取得高胜率,其构建于一个轻量级大语言模型(LLM)之上。PokerGPT 仅需扑克游戏的简单文本信息即可生成决策建议,从而保证了 AI 与人类之间的便捷交互。我们主要将从真实游戏中获取的一组文本记录转化为提示,并利用基于人类反馈的强化学习技术对轻量级预训练 LLM 进行微调。为提升微调性能,我们对原始数据进行提示工程处理,包括过滤有用信息、选择高胜率玩家的行为,并利用多种提示工程技术将其进一步处理为文本指令。通过实验,我们证明 PokerGPT 在胜率、模型大小、训练时间和响应速度方面均优于先前方法,表明 LLM 在解决 IIG 方面具有巨大潜力。
引用
@article{arxiv.2401.06781,
title = {PokerGPT: An End-to-End Lightweight Solver for Multi-Player Texas Hold'em via Large Language Model},
author = {Chenghao Huang and Yanbo Cao and Yinlong Wen and Tao Zhou and Yanru Zhang},
journal= {arXiv preprint arXiv:2401.06781},
year = {2024}
}