中文

带密度比修正的离屏策略优化方法的收敛速率

机器学习 2022-02-15 v2 人工智能

摘要

本文中,我们研究在函数逼近设定下带状态-动作密度比修正的离屏策略改进算法的收敛性质,其中目标函数被表述为一个极大-极大-极小优化问题。我们刻画了学习目标函数的偏差,并给出两种具有有限时间收敛保证的策略。在第一种策略中,我们给出收敛速率为 O(ϵ3)O(\epsilon^{-3}) 的算法 P-SREDA,其对 ϵ\epsilon 的依赖是最优的。在第二种策略中,我们提出一种名为 O-SPIM 的新的离屏策略 actor-critic 风格算法。我们证明 O-SPIM 以总复杂度 O(ϵ4)O(\epsilon^{-4}) 收敛到驻点,这与在屏策略设定下某些近期 actor-critic 算法的收敛速率相匹配。

关键词

引用

@article{arxiv.2106.00993,
  title  = {On the Convergence Rate of Off-Policy Policy Optimization Methods with Density-Ratio Correction},
  author = {Jiawei Huang and Nan Jiang},
  journal= {arXiv preprint arXiv:2106.00993},
  year   = {2022}
}

备注

48 Pages; AISTATS 2022