从模仿到互动:使用浅层强化学习掌握 Schnapsen 游戏
人工智能
2026-05-19 v1 机器学习
摘要
本文探讨浅层神经网络智能体是否能够掌握卡牌游戏 Schnapsen 并挑战基于蒙特卡洛抽样和前瞻搜索的强搜索基准 RdeepBot。通过逐步递增复杂度的实验设计,我们首先评估在回放数据上训练的监督学习智能体 (MLPBot),然后是通过异步蒙特卡洛更新和经验回放训练的强化学习智能体 (RLBot)。结果表明,监督式模仿难以足够泛化以击败强大的 RdeepBot 对手,而强化学习则产生了显著更强的智能体。在聚焦 RdeepBot 深度参数的setting下,最佳表现出现在将学习得到的价值函数与更深的前瞻搜索相结合时,使 RLBot 在针对最强评估 RdeepBot 基准时实现了统计显著的更高胜率。在样本基于的setting中,收益较为条件:最强表现出现在相对较低的 training num_samples 参数处,而非随采样强度均匀提升。
引用
@article{arxiv.2605.17162,
title = {From Imitation to Interaction: Mastering Game of Schnapsen with Shallow Reinforcement Learning},
author = {Ján Klačan and Sizhong Zhang},
journal= {arXiv preprint arXiv:2605.17162},
year = {2026}
}
备注
17 pages, 8 figures