中文

深度原始对偶强化学习:利用 Bellman 对偶性加速 Actor-Critic

机器学习 2017-12-08 v1

摘要

我们基于深度神经网络,针对具有大状态空间与离策略强化学习的马尔可夫决策过程,提出了一种参数化原始对偶 π\pi 学习方法。与基于非线性 Bellman 方程逐次逼近的流行 Q-learning 与 actor-critic 方法不同,我们的方法利用基本的线性 Bellman 对偶性对策略与值函数进行原始对偶更新。使用深度神经网络对原始对偶 π\pi 学习方法进行朴素参数化会遇到两个主要挑战:(1)每次更新需要计算状态空间上的概率分布,难以处理;(2)由于参数化后的拉格朗日函数不再线性,迭代不稳定。我们通过提出一种使用优势函数的带正则惩罚的松弛拉格朗日表述来解决这些挑战。我们表明,在某些特殊情形下,我们方法中的对偶策略更新步骤等价于 actor-critic 方法中的策略梯度更新,而值更新则截然不同。原始对偶 π\pi 学习方法的主要优势在于,值更新与策略更新通过 Bellman 对偶性紧密耦合,因而信息更丰富。在一个简单的 cart-pole 问题上的实验表明,该算法显著优于一步时序差分 actor-critic 方法,即最相关的基准对比方法。我们相信,对值函数与策略函数的原始对偶更新将加速学习过程。所提方法或可为更高效的算法与更精细的理论分析打开一扇门。

关键词

引用

@article{arxiv.1712.02467,
  title  = {Deep Primal-Dual Reinforcement Learning: Accelerating Actor-Critic using Bellman Duality},
  author = {Woon Sang Cho and Mengdi Wang},
  journal= {arXiv preprint arXiv:1712.02467},
  year   = {2017}
}