中文

状态分布失配下 Softmax Off-Policy Actor Critic 的全局最优性与有限样本分析

机器学习 2025-02-07 v4

摘要

在本文中,我们在表格设置下确立了 off-policy actor critic 算法的全局最优性和收敛速率,且未使用密度比来纠正行为策略的状态分布与目标策略状态分布之间的差异。我们的工作超越了现有关于策略梯度方法最优性的研究,因为现有工作使用精确的策略梯度来更新策略参数,而我们使用的是近似的随机更新步骤。我们的更新步骤不是梯度更新,因为我们没有使用密度比来纠正状态分布,这与实际从业者的做法高度一致。我们的更新是近似的,因为我们使用的是学习到的 critic 而非真实的价值函数。我们的更新是随机的,因为在每一步仅对当前的状态-动作对进行更新。此外,我们在分析中移除了现有工作中的几个限制性假设。我们工作的核心是基于一致压缩性质,对在时间非齐次 Markov 链上使用时间非齐次更新算子的通用随机近似算法进行有限样本分析。

关键词

引用

@article{arxiv.2111.02997,
  title  = {Global Optimality and Finite Sample Analysis of Softmax Off-Policy Actor Critic under State Distribution Mismatch},
  author = {Shangtong Zhang and Remi Tachet and Romain Laroche},
  journal= {arXiv preprint arXiv:2111.02997},
  year   = {2025}
}

备注

Journal of Machine Learning Research 2022. This version improves the JMLR camera-ready version by removing all the projection operators in the algorithms