中文

强化学习中的保守探索

机器学习 2020-07-16 v2 机器学习

摘要

在未知马尔可夫决策过程(MDP)中学习时,智能体需要权衡探索(发现关于MDP的新信息)与利用(利用当前知识以最大化奖励)。尽管智能体最终会学到良好或最优策略,但无法保证中间策略的质量。这种缺乏控制的情况在现实应用中是不受欢迎的,因为现实应用的最低要求是所执行策略的性能至少保证不差于现有基线。本文中,我们针对平均奖励和有限时域问题引入保守探索的概念。我们提出两种乐观算法,保证(以高概率)在学习过程中保守约束永不被违反。我们推导了后悔界,表明保守性并不会阻碍这些算法的学习能力。

关键词

引用

@article{arxiv.2002.03218,
  title  = {Conservative Exploration in Reinforcement Learning},
  author = {Evrard Garcelon and Mohammad Ghavamzadeh and Alessandro Lazaric and Matteo Pirotta},
  journal= {arXiv preprint arXiv:2002.03218},
  year   = {2020}
}

备注

AISTATS 2020