中文

在线与近似强化学习中的多步贪婪策略

机器学习 2018-09-21 v2 人工智能 机器学习

摘要

通过蒙特卡洛树搜索或模型预测控制,多步前瞻策略在强化学习中已展现出极高的实证能力。在近期工作 \cite{efroni2018beyond} 中,提出并分析了多步贪婪策略及其在朴素策略迭代算法中的使用。本工作中,我们在更实际的设置下研究多步贪婪算法。我们首先强调一个反直觉的困难,出现于软策略更新时:即便无近似,且与单步贪婪情形相反,除非更新步长足够大,否则无法保证策略单调改进。特别留意此困难后,我们公式化并分析了使用此类多步贪婪算子的在线与近似算法。

关键词

引用

@article{arxiv.1805.07956,
  title  = {Multiple-Step Greedy Policies in Online and Approximate Reinforcement Learning},
  author = {Yonathan Efroni and Gal Dalal and Bruno Scherrer and Shie Mannor},
  journal= {arXiv preprint arXiv:1805.07956},
  year   = {2018}
}

备注

NIPS 2018