优化前瞻树策略:连接前瞻树策略与直接策略搜索的桥梁
系统与控制
2015-03-20 v1 人工智能
机器学习
摘要
直接策略搜索 (Direct Policy Search, DPS) 和前瞻树 (Look-Ahead Tree, LT) 策略是两类广泛用于为序列决策问题生成高性能策略的技术。为了使 DPS 方法有效运作,一个关键问题是针对目标问题选择合适的参数化策略空间。LT 方法的一个根本性问题在于,为了做出良好的决策,此类策略必须构建非常大的前瞻树,这可能需要过多的在线计算资源。在本文中,我们提出了一种位于 DPS 和 LT 交集处的新型混合策略学习方案,其中策略是一种以定向方式构建小型前瞻树的算法,该过程由通过 DPS 学习到的节点评分函数引导。研究表明,基于 LT 的表示是在 DPS 方案中表示策略的一种通用方式,同时,DPS 能够显著减少做出高质量决策所需的前瞻树规模。我们在四个基准领域上将我们的方法与两种最先进的 DPS 技术和四种常见的 LT 策略进行了实验比较,结果表明该方法结合了其源自的两种技术的优势。具体而言,我们表明我们的方法:(1) 生成的策略整体性能优于纯 DPS 和纯 LT 策略;(2) 与其他 DPS 技术相比,所需的策略评估次数大幅减少;(3) 易于调整;(4) 生成的策略对初始条件的扰动具有相当的鲁棒性。
引用
@article{arxiv.1208.4773,
title = {Optimized Look-Ahead Tree Policies: A Bridge Between Look-Ahead Tree Policies and Direct Policy Search},
author = {Tobias Jung and Louis Wehenkel and Damien Ernst and Francis Maes},
journal= {arXiv preprint arXiv:1208.4773},
year = {2015}
}
备注
In Submission