中文

Hanabi的强化学习

机器学习 2025-06-03 v1 人工智能 计算机科学与博弈论 多智能体系统

摘要

Hanabi 已成为强化学习(RL)研究中的一款热门游戏,因为它是少数几种对整个环境具有不完全知识的合作卡牌游戏之一,从而对 RL 智能体构成了挑战。我们探索了不同的表格强化学习和深度强化学习算法,以观察它们在同类型智能体对抗以及其他类型智能体对抗中的最佳表现。我们证实,某些智能体在与特定智能体对抗时打出了最高得分的游戏,而其他智能体则通过适应对手智能体的行为获得了更高的平均分。我们试图量化每种算法提供最佳优势的条件,并确定了不同类型智能体之间最有趣的交互。最终,我们发现时序差分(TD)算法与表格智能体相比具有更好的整体表现和游戏类型平衡。具体而言,表格 Expected SARSA 和深度 Q-Learning 智能体表现最佳。

关键词

引用

@article{arxiv.2506.00458,
  title  = {Reinforcement Learning for Hanabi},
  author = {Nina Cohen and Kordel K. France},
  journal= {arXiv preprint arXiv:2506.00458},
  year   = {2025}
}