强化学习在 Blackjack 中性能的若干变化
人工智能
2023-08-16 v1 机器学习
交易与市场微观结构
摘要
Blackjack(二十一点)是一种流行的基于技巧与运气的纸牌游戏。游戏目标是通过获得比庄家更高且不超过 21 点的手牌总和来获胜。理想的二十一点策略将在长期内最大化财务回报,同时避免赌徒破产。二十一点随机化的环境及其固有的奖励结构提出了一个引人关注的问题,以更好地理解在环境变化下强化学习智能体的表现。在此我们考虑用于最优游戏的 q-learning 解法,并研究算法学习收敛速率作为牌堆数量的函数。还实现了一个允许通用二十一点规则的模拟器,以展示完美使用基本策略与高低法(hi-lo system)的算牌者能在多大程度上令赌场破产,以及环境变化如何影响这一结果。我们工作的新颖性在于将这种对牌堆数量影响的概念性理解置于学习智能体收敛的语境中。
引用
@article{arxiv.2308.07329,
title = {Variations on the Reinforcement Learning performance of Blackjack},
author = {Avish Buramdoyal and Tim Gebbie},
journal= {arXiv preprint arXiv:2308.07329},
year = {2023}
}
备注
12 pages, 15 figures, 7 tables