参数化强化学习中的主动探索
机器学习
2016-10-07 v1
摘要
具有连续动作的在线无模型强化学习方法在处理机器人等现实应用时正发挥着突出作用。然而,当面对非平稳环境时,这些方法关键依赖于探索-利用权衡,而这种权衡很少能动态且自动地适应环境变化。本文我们提出一种用于结构化(参数化)连续动作空间中强化学习的主动探索算法。该框架处理一组离散动作,每个动作均由连续变量参数化。离散探索通过具有逆温度参数β的玻尔兹曼softmax函数控制。同时,对连续动作参数施加高斯探索。我们应用一种基于短期与长期奖励滑动平均值变化比较的元学习算法,以同时调节β和用于抽取连续动作参数的高斯分布宽度。当应用于一个简单的虚拟人机交互任务时,我们证明该算法优于无主动探索的连续参数化RL,也优于基于卡尔曼Q学习算法测量的不确定性变化的主动探索。
引用
@article{arxiv.1610.01986,
title = {Active exploration in parameterized reinforcement learning},
author = {Mehdi Khamassi and Costas Tzafestas},
journal= {arXiv preprint arXiv:1610.01986},
year = {2016}
}
备注
Submitted to EWRL2016