强化学习中的探索与利用:一种随机控制方法
最优化与控制
2019-02-14 v3 机器学习
摘要
我们考虑连续时间下的强化学习(RL),并研究在探索黑箱环境与利用当前知识之间取得最佳权衡的问题。我们提出一种涉及动作分布微分熵的熵正则化奖励函数,并动机清晰地设计出一种探索性特征动力学表述,以捕捉探索下的重复学习。所得的优化问题是经典松弛随机控制的一种复兴。我们在线性—二次(LQ)设定下对该问题进行了完整分析,并推导出用于平衡利用与探索的最优反馈控制分布为高斯分布。这进而解释并证明了 RL 中广泛采用的高斯探索,超越了其采样简便性。此外,利用与探索分别且互斥地由高斯分布的均值与方差刻画。我们还发现,更随机的环境包含更多的学习机会,其意义在于需要更少的探索。我们刻画了探索的代价,对于 LQ 情形,其被证明与熵正则化权重成正比,与折扣率成反比。最后,随着探索权重衰减至零,我们证明了熵正则化 LQ 问题的解收敛于经典 LQ 问题的解。
引用
@article{arxiv.1812.01552,
title = {Exploration versus exploitation in reinforcement learning: a stochastic control approach},
author = {Haoran Wang and Thaleia Zariphopoulou and Xunyu Zhou},
journal= {arXiv preprint arXiv:1812.01552},
year = {2019}
}