中文

利用强化学习求解不确定性下的月球着陆器问题

机器学习 2020-11-25 v1

摘要

强化学习(RL)是机器学习的一个领域,关注使智能体在具有不确定性的环境中导航,以最大化某种累积长期奖励的概念。在本文中,我们在 OpenAI Gym 的 LunarLander-v2 环境中实现并分析了两种不同的 RL 技术:Sarsa 和 Deep Q-Learning。随后我们向原始问题引入额外不确定性,以测试上述技术的鲁棒性。使用我们的最佳模型,在原始问题上 Sarsa 智能体平均奖励达到 170+,Deep Q-Learning 智能体达到 200+。我们还表明这些技术能够克服额外不确定性,两个智能体均取得 100+ 的正平均奖励。随后我们对两种技术进行比较分析,以得出哪种智能体表现更优的结论。

关键词

引用

@article{arxiv.2011.11850,
  title  = {Solving The Lunar Lander Problem under Uncertainty using Reinforcement Learning},
  author = {Soham Gadgil and Yunfeng Xin and Chengzhe Xu},
  journal= {arXiv preprint arXiv:2011.11850},
  year   = {2020}
}