带密度比修正的离屏策略优化方法的收敛速率
机器学习
2022-02-15 v2 人工智能
摘要
本文中,我们研究在函数逼近设定下带状态-动作密度比修正的离屏策略改进算法的收敛性质,其中目标函数被表述为一个极大-极大-极小优化问题。我们刻画了学习目标函数的偏差,并给出两种具有有限时间收敛保证的策略。在第一种策略中,我们给出收敛速率为 的算法 P-SREDA,其对 的依赖是最优的。在第二种策略中,我们提出一种名为 O-SPIM 的新的离屏策略 actor-critic 风格算法。我们证明 O-SPIM 以总复杂度 收敛到驻点,这与在屏策略设定下某些近期 actor-critic 算法的收敛速率相匹配。
引用
@article{arxiv.2106.00993,
title = {On the Convergence Rate of Off-Policy Policy Optimization Methods with Density-Ratio Correction},
author = {Jiawei Huang and Nan Jiang},
journal= {arXiv preprint arXiv:2106.00993},
year = {2022}
}
备注
48 Pages; AISTATS 2022