具有非线性函数逼近的原始对偶Actor-Critic的可证明高效收敛性
机器学习
2022-03-01 v1 机器学习
摘要
我们研究在非凸-非凹原始对偶公式下具有非线性函数逼近的actor-critic算法的收敛性。采用带自适应近端部项的随机梯度下降 ascent 以实现鲁棒学习率。我们展示了原始对偶actor-critic的第一个高效收敛结果,在马尔可夫采样下收敛率为 ,其中 为梯度的逐元素最大值, 为迭代次数, 为梯度维数。我们的结果仅在对偶变量满足Polyak-\L{}ojasiewicz条件下给出,该条件易于验证并适用于广泛的强化学习(RL)场景。该算法与分析具有足够通用性,可应用于其他RL设置,如多智能体RL。在OpenAI Gym连续控制任务上的实证结果佐证了我们的理论发现。
引用
@article{arxiv.2202.13863,
title = {Provably Efficient Convergence of Primal-Dual Actor-Critic with Nonlinear Function Approximation},
author = {Jing Dong and Li Shen and Yinggan Xu and Baoxiang Wang},
journal= {arXiv preprint arXiv:2202.13863},
year = {2022}
}