连续状态POMDP中抗观测噪声的数据高效强化学习
机器学习
2016-02-09 v1 机器学习
系统与控制
摘要
我们提出了一种抗观测噪声的数据高效强化学习算法。我们的方法通过将高度数据高效的PILCO算法(Deisenroth & Rasmussen, 2011)在策略评估时考虑滤波过程,扩展至部分可观测马尔可夫决策过程(POMDPs)。PILCO执行策略搜索,通过首先预测可能系统轨迹的解析分布来评估每个策略。我们额外针对滤波过程预测轨迹,取得了比将滤波器与由原始(未滤波)框架优化的策略相结合显著更高的性能。我们的测试设置是带传感器噪声的cartpole swing-up任务,其涉及非线性动力学并要求非线性控制。
引用
@article{arxiv.1602.02523,
title = {Data-Efficient Reinforcement Learning in Continuous-State POMDPs},
author = {Rowan McAllister and Carl Edward Rasmussen},
journal= {arXiv preprint arXiv:1602.02523},
year = {2016}
}