中文

Double A3C:在 OpenAI Gym 游戏上的深度强化学习

人工智能 2023-03-07 v1 机器学习

摘要

强化学习(RL)是机器学习的一个领域,研究智能体如何在未知环境中采取行动以最大化其奖励。与智能体完全知晓自身状态、奖励和转移概率的经典马尔可夫决策过程(MDP)不同,强化学习利用探索与利用来处理模型的不确定性。在模型通常具有较大状态空间的情况下,可使用神经网络(NN)将其输入状态与输出动作相关联,以最大化智能体的奖励。然而,构建和训练高效的神经网络具有挑战性。受 Double Q-learning 和异步优势 actor-critic(A3C)算法的启发,我们将提出并实现一种改进的 Double A3C 算法,该算法结合两种算法的优势,用于玩 OpenAI Gym Atari 2600 游戏,以在我们的项目中击败其基准。

关键词

引用

@article{arxiv.2303.02271,
  title  = {Double A3C: Deep Reinforcement Learning on OpenAI Gym Games},
  author = {Yangxin Zhong and Jiajie He and Lingjie Kong},
  journal= {arXiv preprint arXiv:2303.02271},
  year   = {2023}
}