中文

以蒙特卡洦树搜索改进 Q 函数价值估计与奖励重构

机器学习 2024-10-24 v2 人工智能 多智能体系统

摘要

强化学习在诸如围棋和 Atari 等完美信息游戏中取得了显著成功,使智能体能够以最高水平与人类玩家竞技。然而,针对不完美信息游戏的强化学习研究相对有限,due to 更复杂的游戏结构和随机性。传统方法在训练和提升不完美信息游戏的性能方面面临挑战,due to Q 值估计不准确和奖励稀疏等问题。在本文中,我们聚焦于一种不完美信息游戏—— Uno,旨在通过减少 Q 值过度估计和重构奖励函数来解决这些问题。我们提出一种新算法,利用蒙特卡洦树搜索对 Q 函数中的价值估计进行平均。虽然我们以 Double 深度 Q 学习作为本文的基础框架,但该方法可以推广到任何需要 Q 值估计的算法,如 Actor-Critic。此外,我们运用蒙特卡洦树搜索重构游戏环境中的奖励结构。我们将该算法与几种传统方法进行比较,这些方法已应用于诸如 Double 深度 Q 学习、Deep 蒙特卡洦和 Neural Fictitious Self Play 等游戏。实验表明,我们的算法在所有比较方法中均表现出色,尤其是在 Uno 玩家数量增加时表现更佳,表明更高的难度。

关键词

引用

@article{arxiv.2410.11642,
  title  = {Improve Value Estimation of Q Function and Reshape Reward with Monte Carlo Tree Search},
  author = {Jiamian Li},
  journal= {arXiv preprint arXiv:2410.11642},
  year   = {2024}
}