策略搜索:任何局部最优解均享有全局性能保证
机器学习
2013-06-07 v1 人工智能
机器人学
最优化与控制
摘要
局部策略搜索是一种用于处理大状态空间的流行强化学习方法。形式上,它在参数化策略空间中进行局部搜索,以最大化在某些预定义分布上平均的相关价值函数。人们普遍可能认为,从这种方法中一般能期望得到的最好结果就是该准则的局部最优解。在本文中,我们展示了以下令人惊讶的结果:\emph{任何}(近似)\emph{局部最优解}都享有\emph{全局性能保证}。我们将此保证与直接策略迭代(一种执行某种形式策略搜索的近似动态规划算法)所满足的保证进行了比较:如果局部策略搜索的近似误差通常可能更大(因为局部搜索需要考虑随机策略空间),我们认为性能界中出现的集中系数要好得多。最后,我们讨论了分析结果的若干实际和理论后果。
引用
@article{arxiv.1306.1520,
title = {Policy Search: Any Local Optimum Enjoys a Global Performance Guarantee},
author = {Bruno Scherrer and Matthieu Geist},
journal= {arXiv preprint arXiv:1306.1520},
year = {2013}
}