单时间尺度Actor-Critic的小增益分析
最优化与控制
2023-05-26 v4 机器学习
系统与控制
系统与控制
摘要
我们考虑一种actor-critic的变体,其使用比例步长,且每次actor步仅用来自平稳分布的单个样本进行一次critic更新。我们利用小增益定理对该方法进行分析。具体而言,我们证明该方法可用于寻找驻点,并且由此得到的样本复杂度将actor-critic方法的现有最优结果改进为 ,以寻找 -近似驻点,其中 是与critic相关的条件数。
引用
@article{arxiv.2203.02591,
title = {A Small Gain Analysis of Single Timescale Actor Critic},
author = {Alex Olshevsky and Bahman Gharesifard},
journal= {arXiv preprint arXiv:2203.02591},
year = {2023}
}