中文

非平稳环境下策略优化的动态后悔界

机器学习 2020-07-02 v1 最优化与控制 机器学习

摘要

我们考虑在具有对抗性全信息奖励反馈和未知固定转移核的分段式马尔可夫决策过程(MDP)中进行强化学习(RL)。我们提出两种无模型策略优化算法 POWER 和 POWER++,并建立了它们的动态后悔保证。与经典的静态后悔概念相比,动态后悔是一种更强的概念,因为它明确考虑了环境的非平稳性。所提算法达到的动态后悔在不同非平稳性机制之间插值,并且满足自适应(近)最优性概念,即在慢变环境下匹配(近)最优静态后悔。动态后悔界包含两个部分,一个来自探索,处理转移核的不确定性;另一个来自适应,处理非平稳环境。具体而言,我们表明 POWER++ 通过预测主动适应非平稳性,在动态后悔的第二个分量上优于 POWER。据我们所知,我们的工作是无模型 RL 算法在非平稳环境中动态后悔分析的首次工作。

关键词

引用

@article{arxiv.2007.00148,
  title  = {Dynamic Regret of Policy Optimization in Non-stationary Environments},
  author = {Yingjie Fei and Zhuoran Yang and Zhaoran Wang and Qiaomin Xie},
  journal= {arXiv preprint arXiv:2007.00148},
  year   = {2020}
}