中文

强化学习中稀疏最优策略的正则化方法

机器学习 2019-10-22 v3 机器学习

摘要

我们提出并研究了一种正则化马尔可夫决策过程(MDPs)的通用框架,其目标是找到最优策略,使期望折扣总回报加上策略正则化项最大化。已有的熵正则化 MDPs 可纳入我们的框架。此外,在我们的框架下,许多正则化项可带来多模态性和稀疏性,这在强化学习中具有潜在用途。特别地,我们给出了诱导稀疏最优策略的充分必要条件。我们还对所提出的正则化 MDPs 进行了完整的数学分析,包括最优性条件、性能误差和稀疏度控制。我们提供了设计正则化形式的通用方法,并提出了复杂环境设置下的离策略 actor critic 算法。我们通过实验分析了最优策略的数值性质,并比较了离散与连续环境中不同稀疏正则化形式的性能。

关键词

引用

@article{arxiv.1903.00725,
  title  = {A Regularized Approach to Sparse Optimal Policy in Reinforcement Learning},
  author = {Xiang Li and Wenhao Yang and Zhihua Zhang},
  journal= {arXiv preprint arXiv:1903.00725},
  year   = {2019}
}