带选项的马尔可夫决策过程中的探索与利用
机器学习
2017-04-18 v2 机器学习
摘要
尽管大量实证结果表明时间扩展动作和选项可能显著影响智能体的学习性能,但对选项在在线强化学习中如何以及何时能带来益处的理论理解仍相对有限。本文针对一种使用选项的 UCRL 变体,推导了其遗憾值的上界和下界。我们首先在半马尔可夫决策过程的一般情形下分析该算法,然后展示如何将这些结果转化到带选项的马尔可夫决策过程这一特定情形,并举例说明在一些简单场景中,使用选项进行学习的遗憾值可被证明远小于使用原始动作学习时的遗憾值。
引用
@article{arxiv.1703.08667,
title = {Exploration--Exploitation in MDPs with Options},
author = {Ronan Fruit and Alessandro Lazaric},
journal= {arXiv preprint arXiv:1703.08667},
year = {2017}
}