中文

具有非线性函数逼近的原始对偶Actor-Critic的可证明高效收敛性

机器学习 2022-03-01 v1 机器学习

摘要

我们研究在非凸-非凹原始对偶公式下具有非线性函数逼近的actor-critic算法的收敛性。采用带自适应近端部项的随机梯度下降 ascent 以实现鲁棒学习率。我们展示了原始对偶actor-critic的第一个高效收敛结果,在马尔可夫采样下收敛率为 O(ln(NdG2)N)\mathcal{O}\left(\sqrt{\frac{\ln \left(N d G^2 \right)}{N}}\right),其中 GG 为梯度的逐元素最大值, NN 为迭代次数, dd 为梯度维数。我们的结果仅在对偶变量满足Polyak-\L{}ojasiewicz条件下给出,该条件易于验证并适用于广泛的强化学习(RL)场景。该算法与分析具有足够通用性,可应用于其他RL设置,如多智能体RL。在OpenAI Gym连续控制任务上的实证结果佐证了我们的理论发现。

关键词

引用

@article{arxiv.2202.13863,
  title  = {Provably Efficient Convergence of Primal-Dual Actor-Critic with Nonlinear Function Approximation},
  author = {Jing Dong and Li Shen and Yinggan Xu and Baoxiang Wang},
  journal= {arXiv preprint arXiv:2202.13863},
  year   = {2022}
}