中文

有偏策略梯度算法的二阶收敛性研究

机器学习 2024-05-15 v4

摘要

由于强化学习问题的目标函数通常高度非凸,期望最常用的策略梯度算法能够逃离鞍点并到达二阶驻点。现有结果仅考虑具有无偏梯度估计器的原始策略梯度算法,但在无限 horizon 折扣奖励设置下的实际实现由于有限 horizon 采样而存在偏差。此外,演员-评论家(actor-critic)方法的二阶收敛性尚未确立,其因评论家对值函数的近似而同样存在偏差。我们提供了对有偏策略梯度方法的新型二阶分析,包括由轨迹蒙特卡洛采样计算的原始梯度估计器以及双循环演员-评论家算法,其中内循环中评论家通过 TD(0) 学习改进值函数的近似。此外,我们还建立了 TD(0) 在马尔可夫链上独立于初始状态分布的收敛性。

关键词

引用

@article{arxiv.2311.02546,
  title  = {On the Second-Order Convergence of Biased Policy Gradient Algorithms},
  author = {Siqiao Mu and Diego Klabjan},
  journal= {arXiv preprint arXiv:2311.02546},
  year   = {2024}
}