Double A3C:在 OpenAI Gym 游戏上的深度强化学习
人工智能
2023-03-07 v1 机器学习
摘要
强化学习(RL)是机器学习的一个领域,研究智能体如何在未知环境中采取行动以最大化其奖励。与智能体完全知晓自身状态、奖励和转移概率的经典马尔可夫决策过程(MDP)不同,强化学习利用探索与利用来处理模型的不确定性。在模型通常具有较大状态空间的情况下,可使用神经网络(NN)将其输入状态与输出动作相关联,以最大化智能体的奖励。然而,构建和训练高效的神经网络具有挑战性。受 Double Q-learning 和异步优势 actor-critic(A3C)算法的启发,我们将提出并实现一种改进的 Double A3C 算法,该算法结合两种算法的优势,用于玩 OpenAI Gym Atari 2600 游戏,以在我们的项目中击败其基准。
引用
@article{arxiv.2303.02271,
title = {Double A3C: Deep Reinforcement Learning on OpenAI Gym Games},
author = {Yangxin Zhong and Jiajie He and Lingjie Kong},
journal= {arXiv preprint arXiv:2303.02271},
year = {2023}
}