中文

理解强化学习中近似策略评估与贪婪化结合时的病态行为

机器学习 2020-10-30 v1 人工智能

摘要

尽管取得了经验上的成功,带有值函数近似的强化学习(RL)理论仍从根本上不完整。先前工作已识别出在结合近似同策略评估与贪婪化的 RL 算法中出现的多种病态行为。一个突出例子是策略振荡,即算法可能在策略间无限循环,而非收敛到不动点。然而,人们对于振荡区域内策略的质量理解不足。本文中我们给出简单示例说明,除策略振荡与多个不动点外——同一基本问题可导致收敛到给定近似下的最差可能策略。此类行为可在算法优化由当前策略下出现的状态分布加权的评估精度、但基于该分布下罕见或不存在的状态的值进行贪婪化时产生。这意味着用于贪婪化的值不可靠,并将策略引向不期望的方向。我们观察到这可导致最差可能策略,表明此类算法在一般意义下不可靠。此类示例的存在有助于缩小可能的理论保证种类以及可能有助的算法思想种类。我们通过分析与实验证明此类病态行为可影响广泛的 RL 与动态规划算法;此类行为可有无自举地出现,也可有自举地出现,且可随线性函数近似以及如神经网络等更复杂参数化函数出现。

关键词

引用

@article{arxiv.2010.15268,
  title  = {Understanding the Pathologies of Approximate Policy Evaluation when Combined with Greedification in Reinforcement Learning},
  author = {Kenny Young and Richard S. Sutton},
  journal= {arXiv preprint arXiv:2010.15268},
  year   = {2020}
}