面向连续状态与动作马尔可夫决策过程中实时探索的在线强化学习
人工智能
2016-12-19 v1 机器学习
摘要
本文提出一种在连续状态、连续动作、无模型马尔可夫决策过程中学习在线策略的新方法,该方法具有对实际应用至关重要的两个性质。首先,策略以极低计算成本可实现:一旦计算出策略,给定状态对应的动作可关于所用样本数量以对数时间获得。其次,我们的方法通用:不依赖于最优策略结构的任何先验知识。我们基于拟合Q迭代算法构建,该算法将值表示为若干回归树的平均值。我们的算法,即拟合策略森林算法(FPF),计算表示Q值的回归森林并将其转换为表示策略的单棵树,同时利用重采样和叶子合并控制策略大小。我们引入多分辨率探索(MRE)的一种适配,其特别适合FPF。我们在三个经典强化学习基准上评估FPF性能:“倒立摆”、“双积分器”和“山地车”,并展示FPF持平或优于其他算法,尽管这些算法依赖于使用特别选择的策略表示以适配这三个问题。最后,我们展示FPF与MRE的结合能在-贪婪方法会失败的问题中找到近似最优解。
引用
@article{arxiv.1612.03780,
title = {Online Reinforcement Learning for Real-Time Exploration in Continuous State and Action Markov Decision Processes},
author = {Ludovic Hofer and Hugo Gimbert},
journal= {arXiv preprint arXiv:1612.03780},
year = {2016}
}