中文

单时间尺度Actor-Critic的小增益分析

最优化与控制 2023-05-26 v4 机器学习 系统与控制 系统与控制

摘要

我们考虑一种actor-critic的变体,其使用比例步长,且每次actor步仅用来自平稳分布的单个样本进行一次critic更新。我们利用小增益定理对该方法进行分析。具体而言,我们证明该方法可用于寻找驻点,并且由此得到的样本复杂度将actor-critic方法的现有最优结果改进为 O(μ2ϵ2)O \left(\mu^{-2} \epsilon^{-2} \right),以寻找 ϵ\epsilon-近似驻点,其中 μ\mu 是与critic相关的条件数。

关键词

引用

@article{arxiv.2203.02591,
  title  = {A Small Gain Analysis of Single Timescale Actor Critic},
  author = {Alex Olshevsky and Bahman Gharesifard},
  journal= {arXiv preprint arXiv:2203.02591},
  year   = {2023}
}