中文

Yahtzee:基于蒙特卡洛树搜索的强化学习技术

环与代数 2026-01-05 v1 逻辑

摘要

Yahtzee 是一款具有随机性、组合结构及延迟奖励的经典掷骰子游戏,具有一定的中等规模强化学习基准测试价值。虽然可以使用动态规划方法计算出 solitaire Yahtzee 的最优策略,但多人游戏则难以求解,这就动机了近似方法。我们将Yahtzee建模为马尔可夫决策过程(MDP),并使用各种策略梯度方法训练自我对弈智能体:REINFORCE、优势演员-评论家(A2C),以及近端策略优化(PPO),所有方法均使用具有共享主干的多头网络。我们对特征和动作编码、网络结构、收益估计器以及熵正则化进行消融实验,以理解其对学习的影响。在固定训练预算下,REINFORCE和PPO对超参数敏感,未能接近最优性能,而A2C在各种设置下都能稳健训练。我们的智能体在100,000场评估游戏中获得了241.78的中位数得分,距离最优DP得分254.59的5.0%,实现了上部区域奖励和Yahtzee的分别为24.9%和34.1%。所有模型在学习上部奖励策略方面都有困难,过度依赖四条龙,这凸显了长期信任分配和探索方面的持久挑战。

关键词

引用

@article{arxiv.2601.00006,
  title  = {An addendum to "The theory of implicit operations"},
  author = {Luca Carai and Miriam Kurtzhals and Tommaso Moraschini},
  journal= {arXiv preprint arXiv:2601.00006},
  year   = {2026}
}

备注

Addendum to arXiv:2512.14326