基于精确 Blackjack 信源评估模型无关策略优化在掩码动作环境中的表现
机器学习
2026-03-20 v1
摘要
无限分数卡布莱克杰提供了一个严格且可精确验证的离散随机控制基准,环境中存在动态掩码动作。在固定的赌厅规则(S17、3:2 赔率、纸牌 peek、任意两张牌可双倍、可分裂后再双倍、最多可再分裂四次)下,推导了覆盖 4600 个标准决策单元的精确动态规划(DP)信源。该信源产生ground-truth 动作价值、最优策略标签以及 -0.00161 的理论期望价值(EV)每局。为评估样本高效的策略恢复,在 10^6 手局中训练了三个 model-free 优化器:带每个单元指数移动平均基线的掩码 REINFORCE、simultaneous perturbation stochastic approximation(SPSA),以及交叉熵方法(CEM)。REINFORCE 最具样本效率,实现了 46.37% 的动作匹配率,EV 为 -0.04688,优于 CEM(39.46%,7.5×10^6 次评估)和 SPSA(38.63%,4.8×10^6 次评估)。然而,所有方法都表现出显著的单元条件性后悔,尽管奖励收敛平滑,仍存在策略层面的错误。此差距表明,带严重状态访问稀疏性和动态动作掩码的表格环境仍然具有挑战性,而综合奖励曲线可能掩盖关键的局部失败。作为负控制,证明并经验确认,在无计数的独立抽样下,最优赌注大小退化为桌面最低注。此外,更大的赌注严格增加波动性和破产风险,而不提升期望收益。这些结果凸显了使用精确信源和负控制以避免将随机波动误认为真正算法性能的必要性。
引用
@article{arxiv.2603.18642,
title = {Evaluating Model-Free Policy Optimization in Masked-Action Environments via an Exact Blackjack Oracle},
author = {Kevin Song},
journal= {arXiv preprint arXiv:2603.18642},
year = {2026}
}
备注
23 pages, 2 figures, 3 tables, 6 supplementary figures