中文

热启动演员-评论家:从近似误差到次优性间隙

机器学习 2023-06-21 v1 人工智能

摘要

热启动(Warm-Start)强化学习(RL)借助离线训练获得的先验策略,正成为实际应用中有前景的 RL 方法。最近的实证研究已表明,热启动 RL 的性能在某些情况下可快速提升,但在其他情况下(尤其当使用函数近似时)会变得停滞。为此,本工作的主要目标是建立对“在线学习是否以及何时能被来自离线 RL 的热启动策略显著加速?”的基本理解。具体而言,我们考虑广泛使用的带先验策略的演员-评论家(A-C)方法。我们首先分别量化演员更新和评论家更新中的近似误差。接下来,我们将热启动 A-C 算法视为带扰动的牛顿法,并研究近似误差对具有不准确演员/评论家更新的有限时间学习性能的影响。在一些通用技术条件下,我们推导出上界,这为在热启动 A-C 算法中实现所需的有限学习性能提供了启示。特别是,我们的发现揭示了降低在线学习中算法偏差至关重要。我们还获得了热启动 A-C 算法次优性间隙的下界,以量化偏差和误差传播的影响。

关键词

引用

@article{arxiv.2306.11271,
  title  = {Warm-Start Actor-Critic: From Approximation Error to Sub-optimality Gap},
  author = {Hang Wang and Sen Lin and Junshan Zhang},
  journal= {arXiv preprint arXiv:2306.11271},
  year   = {2023}
}

备注

ICML 2023 Oral