中文

基于目标的行动者-评论者算法与线性函数逼近的分析

机器学习 2022-02-24 v2 最优化与控制 机器学习

摘要

集成了目标网络的行动者-评论者方法在深度强化学习中已展现出惊人的经验成功。然而,文献中很大程度上缺乏对行动者-评论者方法中使用目标网络的理论理解。在本文中,我们通过提出首个在折扣奖励设定下带有线性函数逼近的在线基于目标的行动者-评论者算法的理论分析,缩小了理论与实践之间的差距。我们的算法使用三个不同的时间尺度:一个用于行动者,两个用于评论者。我们没有使用标准的单时间尺度时序差分(TD)学习算法作为评论者,而是使用了一种受实现目标网络的实用行动者-评论者算法密切启发的双时间尺度基于目标的 TD 学习版本。首先,我们建立了在马尔可夫采样下评论者与行动者的渐近收敛结果。然后,我们提供了有限时间分析,展示了将目标网络引入行动者-评论者方法的影响。

关键词

引用

@article{arxiv.2106.07472,
  title  = {Analysis of a Target-Based Actor-Critic Algorithm with Linear Function Approximation},
  author = {Anas Barakat and Pascal Bianchi and Julien Lehmann},
  journal= {arXiv preprint arXiv:2106.07472},
  year   = {2022}
}

备注

50 pages