中文

基于值梯度的强化学习的局部最优性及其与策略梯度学习的关系

机器学习 2011-01-04 v1 人工智能

摘要

在这篇理论性论文中,我们关注的是通过平滑的通用函数逼近器学习值函数,以解决大规模连续状态空间中的确定性情节控制问题。我们证明,在由贪婪策略生成的轨迹上的每一点学习值函数的梯度,是该轨迹达到局部极值(且通常是局部最优)的充分条件,并论证这能带来更高的值函数学习效率。这与传统的值函数学习(需要在整个状态空间上学习值函数)形成对比。我们还证明,将策略梯度学习应用于基于值函数的贪婪策略,会产生与值梯度权重更新等价的权重更新,这揭示了强化学习这两种替代范式之间的惊人联系,并为使用通用平滑函数逼近器表示值函数的控制问题提供了收敛性证明。

关键词

引用

@article{arxiv.1101.0428,
  title  = {The Local Optimality of Reinforcement Learning by Value Gradients, and its Relationship to Policy Gradient Learning},
  author = {Michael Fairbank and Eduardo Alonso},
  journal= {arXiv preprint arXiv:1101.0428},
  year   = {2011}
}