中文

Stable Baselines 中深度 Q 学习的 Q 值演化

机器学习 2020-04-27 v1 机器学习

摘要

我们研究了 Stable Baselines 库中深度 Q 学习(DQL)实现的 Q 值演化。Stable Baselines 集成了最新的强化学习技术,并在许多游戏环境中取得了超越人类的表现。然而,对于一些简单的非游戏环境,Stable Baselines 中的 DQL 可能难以找到正确的动作。在本文中,我们旨在理解这种次优行为可能发生的环境类型,并研究各状态下 Q 值的相应演化。我们将一个智能的 TrafficLight 环境(表现较差)与 AI Gym 的 FrozenLake 环境(表现完美)进行了比较。我们观察到,DQL 在 TrafficLight 中表现不佳,是因为动作是可逆的,因此给定状态下的 Q 值比在 FrozenLake 中更为接近。随后,我们使用 Achiam 等人近期提出的分解技术研究了 Q 值的演化。我们观察到,对于 TrafficLight,函数逼近误差以及状态之间的复杂关系导致了某些 Q 值远离最优值的徘徊情况。

关键词

引用

@article{arxiv.2004.11766,
  title  = {Evolution of Q Values for Deep Q Learning in Stable Baselines},
  author = {Matthew Andrews and Cemil Dibek and Karina Palyutina},
  journal= {arXiv preprint arXiv:2004.11766},
  year   = {2020}
}