深度强化学习模型比较研究:DQN vs PPO vs A2C
机器学习
2024-07-22 v1
摘要
本研究在 BreakOut Atari 游戏环境中对三种先进的深度强化学习模型进行比较分析:深度 Q 网络(DQN)、近端策略优化(PPO)和优势演员-评论家(A2C)。我们的研究在受控环境下评估这些模型的性能和有效性。通过严格的实验, 我们检验每个模型的学习效率、策略开发和在动态游戏条件下的适应性。这些发现为在基于游戏的学习环境中应用这些模型提供了关键见解, 并为更广泛地理解这些模型的能力做出贡献。代码已公开于 github.com/Neilus03/DRL_comparative_study。
关键词
引用
@article{arxiv.2407.14151,
title = {A Comparative Study of Deep Reinforcement Learning Models: DQN vs PPO vs A2C},
author = {Neil De La Fuente and Daniel A. Vidal Guerra},
journal= {arXiv preprint arXiv:2407.14151},
year = {2024}
}
备注
8 pages, Accepted at KDD 2024