在线与近似强化学习中的多步贪婪策略
机器学习
2018-09-21 v2 人工智能
机器学习
摘要
通过蒙特卡洛树搜索或模型预测控制,多步前瞻策略在强化学习中已展现出极高的实证能力。在近期工作 \cite{efroni2018beyond} 中,提出并分析了多步贪婪策略及其在朴素策略迭代算法中的使用。本工作中,我们在更实际的设置下研究多步贪婪算法。我们首先强调一个反直觉的困难,出现于软策略更新时:即便无近似,且与单步贪婪情形相反,除非更新步长足够大,否则无法保证策略单调改进。特别留意此困难后,我们公式化并分析了使用此类多步贪婪算子的在线与近似算法。
引用
@article{arxiv.1805.07956,
title = {Multiple-Step Greedy Policies in Online and Approximate Reinforcement Learning},
author = {Yonathan Efroni and Gal Dalal and Bruno Scherrer and Shie Mannor},
journal= {arXiv preprint arXiv:1805.07956},
year = {2018}
}
备注
NIPS 2018