中文

面向一般效用强化学习的变分策略梯度方法

机器学习 2020-07-07 v1 机器学习

摘要

近年来,具有超越累积奖励之和的一般目标的强化学习(RL)系统受到关注,例如约束问题、探索以及基于先验经验的行动。本文考虑马尔可夫决策问题中的策略优化,其中目标是状态-动作占据测度的一般凹效用函数,其将上述若干例子作为特例涵盖。此种一般性使贝尔曼方程失效。由于这意味着动态规划不再适用,我们聚焦于直接策略搜索。类比于累积奖励 RL 中可用的策略梯度定理 \cite{sutton2000policy},我们推导了面向一般效用 RL 的新变分策略梯度定理,其确立参数化策略梯度可作为涉及效用函数 Fenchel 对偶的随机鞍点问题的解获得。我们开发了变分蒙特卡洛梯度估计算法,基于样本路径计算策略梯度。我们证明该变分策略梯度方案对一般目标全局收敛至最优策略,尽管优化问题非凸。我们还通过利用问题的隐凸性确立其 O(1/t)O(1/t) 阶收敛速率,并证明当问题具有隐强凸性时指数收敛。我们的分析以累积奖励的标准 RL 问题为特例,此时我们的结果改进了已有收敛速率。

关键词

引用

@article{arxiv.2007.02151,
  title  = {Variational Policy Gradient Method for Reinforcement Learning with General Utilities},
  author = {Junyu Zhang and Alec Koppel and Amrit Singh Bedi and Csaba Szepesvari and Mengdi Wang},
  journal= {arXiv preprint arXiv:2007.02151},
  year   = {2020}
}