面向利用深度强化学习自动化 Codenames 间谍大师的研究
计算与语言
2023-01-02 v1 人工智能
机器学习
摘要
尽管大多数强化学习研究集中于竞争性游戏,但将其应用于合作型多人游戏或基于文本的游戏的工作很少。Codenames 是一款兼具非对称合作与自然语言处理的桌游,这使其成为推进强化学习研究的绝佳候选。据我所知,本工作是首个将 Codenames 形式化为马尔可夫决策过程,并将 SAC、PPO、A2C 等一些知名强化学习算法应用于该环境的。尽管上述算法在 Codenames 环境中均未收敛,在一个称为 ClickPixel 的简化环境中它们也同样未收敛,除非棋盘规模较小。
引用
@article{arxiv.2212.14104,
title = {Towards automating Codenames spymasters with deep reinforcement learning},
author = {Sherman Siu},
journal= {arXiv preprint arXiv:2212.14104},
year = {2023}
}