通过行为策略搜索实现数据高效的策略评估
人工智能
2017-06-13 v1
摘要
我们考虑评估马尔可夫决策过程(MDP)策略的任务。评估策略的标准无偏技术是部署该策略并观察其性能。我们表明,从部署不同的策略(通常称为行为策略)中收集的数据可用于产生比标准技术均方误差更低的无偏估计。我们推导出了最优行为策略的解析表达式——即最小化所得估计均方误差的行为策略。由于该表达式在实践中依赖于未知的项,我们提出了一个新的策略评估子问题:行为策略搜索,即搜索能降低均方误差的行为策略。我们提出了一种行为策略搜索算法,并实证证明了其在降低策略性能估计均方误差方面的有效性。
引用
@article{arxiv.1706.03469,
title = {Data-Efficient Policy Evaluation Through Behavior Policy Search},
author = {Josiah P. Hanna and Philip S. Thomas and Peter Stone and Scott Niekum},
journal= {arXiv preprint arXiv:1706.03469},
year = {2017}
}
备注
Accepted to ICML 2017; Extended version; 15 pages