中文

使用强化学习与循环神经网络玩六角格与算子兵棋

机器学习 2025-02-20 v1

摘要

六角格与算子兵棋(Hex and Counter Wargames)是对真实军事冲突的对抗性双方模拟,需要复杂的战略决策。与经典棋盘游戏不同,这类游戏具有复杂的地形/单位交互、单位堆叠、大小各异的大地图,以及涉及数百个单位的同步移动与战斗决策。本文引入了一个新颖的系统,旨在通过将循环神经网络的前沿进展与可靠的现代强化学习算法AlphaZero相结合,来应对六角格与算子兵棋的战略复杂性。该系统利用在现有研究基础上开发的新型神经网络架构,并结合了为这些特定游戏环境量身定制的创新状态与动作表示。仅需少量训练,我们的解决方案在典型场景中便展现出了可喜的结果,证明了在不同地形和战术情况下的泛化能力。此外,我们还探索了该系统扩展到更大地图尺寸的潜力。所开发的系统是开放可访问的,促进了在这一充满挑战的领域内的持续研究与探索。

关键词

引用

@article{arxiv.2502.13918,
  title  = {Playing Hex and Counter Wargames using Reinforcement Learning and Recurrent Neural Networks},
  author = {Guilherme Palma and Pedro A. Santos and João Dias},
  journal= {arXiv preprint arXiv:2502.13918},
  year   = {2025}
}