中文

RAMario:爬行动物算法(Reptile)在强化学习玩马里奥中的实验方法

机器学习 2023-05-17 v1 多智能体系统

摘要

本研究论文提出了一种使用 Reptile 算法进行强化学习来训练神经网络游玩超级马里奥兄弟的实验方法。我们使用 Super Mario Bros Gym 库和 Python 中的 TensorFlow 实现 Reptile 算法,创建了一个含单个卷积层、一个展平层和一个全连接层的神经网络模型。我们定义优化器并使用 Reptile 类创建 Reptile 元学习算法的实例。我们使用多个任务与回合训练模型,利用神经网络模型的当前权重选择动作,在环境中执行这些动作,并使用 Reptile 算法更新模型权重。我们通过打印每个回合的总奖励来评估算法性能。此外,我们将 Reptile 算法方法与应用于同一超级马里奥兄弟任务的另两种流行强化学习算法——近端策略优化(PPO)和深度 Q 网络(DQN)——的性能进行比较。我们的结果表明,Reptile 算法为视频游戏 AI 中的少样本学习提供了一种有前景的方法,性能与另两种算法相当甚至更优,尤其在 1M 训练回合下智能体执行的移动次数与距离之比方面。结果显示,游戏环境中世界 1-2 的最佳总距离分别为约 1732(PPO)、约 1840(DQN)和约 2300(RAMario)。完整代码见 https://github.com/s4nyam/RAMario。

关键词

引用

@article{arxiv.2305.09655,
  title  = {RAMario: Experimental Approach to Reptile Algorithm -- Reinforcement Learning for Mario},
  author = {Sanyam Jain},
  journal= {arXiv preprint arXiv:2305.09655},
  year   = {2023}
}