中文

带线性函数逼近的离屏自然 actor-critic 的有限样本分析

机器学习 2022-04-13 v2 最优化与控制

摘要

本文提出了一种带线性函数逼近的离屏自然 actor-critic 算法的新变体,并建立了 O(ϵ3)\mathcal{O}(\epsilon^{-3}) 的样本复杂度,优于此前所有已知的此类算法的收敛界。为了克服函数逼近下离屏策略评估中因致命三元组引起的发散,我们开发了一个采用 nn 步 TD-学习算法并适当选取 nn 的评论者。我们在恒定和递减步长下给出了该评论者的有限样本收敛界,这具有独立的意义。此外,我们开发了函数逼近下的自然策略梯度变体,在 TT 次迭代后收敛速率提升至 O(1/T)\mathcal{O}(1/T)。结合 actor 与 critic 的有限样本误差界,我们得到了 O(ϵ3)\mathcal{O}(\epsilon^{-3}) 的样本复杂度。我们的样本复杂度界仅基于行为策略充分探索所有状态和动作的假设,相较于相关文献这是一个轻得多的假设。

关键词

引用

@article{arxiv.2105.12540,
  title  = {Finite-Sample Analysis of Off-Policy Natural Actor-Critic with Linear Function Approximation},
  author = {Zaiwei Chen and Sajad Khodadadian and Siva Theja Maguluri},
  journal= {arXiv preprint arXiv:2105.12540},
  year   = {2022}
}