中文

三时间尺度约束Actor-Critic与约束自然Actor-Critic算法的有限时间分析

机器学习 2025-09-01 v4

摘要

Actor-Critic方法在广泛强化学习任务中尤其是状态-动作空间较大时找到了大量应用。在本文中,我们考虑带有函数近似的actor-critic和自然actor-critic算法用于涉及不等式约束的约束马尔可夫决策过程(C-MDP),并在非独立同分布(马尔可夫)设定下对这两种算法进行非渐近分析。我们考虑长期平均代价准则,其中目标和约束函数均为某些规定代价函数的合适策略依赖长期平均。我们使用拉格朗日乘子法处理不等式约束。我们证明这些算法保证能找到性能(拉格朗日)函数L(θ,γ)L(\theta,\gamma)的一阶驻点(即L(θ,γ)22ϵ\Vert \nabla L(\theta,\gamma)\Vert_2^2 \leq \epsilon),在约束Actor-Critic(C-AC)和约束自然Actor-Critic(C-NAC)算法情况下的样本复杂度均为O~(ϵ2.5)\mathcal{\tilde{O}}(\epsilon^{-2.5})。我们还展示了在三种不同Safety-Gym环境中的实验结果。

关键词

引用

@article{arxiv.2310.16363,
  title  = {Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms},
  author = {Prashansa Panda and Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:2310.16363},
  year   = {2025}
}