中文

具有相容函数逼近的单循环(自然)Actor-Critic 的非渐近分析

机器学习 2024-06-05 v1 人工智能 机器学习

摘要

Actor-Critic (AC) 是强化学习中学习最优策略的一种强大方法,其中评论家使用算法(例如带有函数逼近的时间差分(TD)学习)来评估当前策略,而行动者利用来自评论家的信息沿着近似梯度方向更新策略。本文为 AC 和自然 AC (NAC) 算法提供了最紧的非渐近收敛界。具体而言,现有研究表明,AC 收敛到平稳点的 ϵ+εcritic\epsilon+\varepsilon_{\text{critic}} 邻域,其最佳已知样本复杂度为 O(ϵ2)\mathcal{O}(\epsilon^{-2})(对数因子内),而 NAC 收敛到全局最优的 ϵ+εcritic+εactor\epsilon+\varepsilon_{\text{critic}}+\sqrt{\varepsilon_{\text{actor}}} 邻域,其最佳已知样本复杂度为 O(ϵ3)\mathcal{O}(\epsilon^{-3}),其中 εcritic\varepsilon_{\text{critic}} 是评论家的逼近误差,εactor\varepsilon_{\text{actor}} 是由参数化策略类表达能力不足引起的逼近误差。本文分析了具有相容函数逼近的 AC 和 NAC 算法的收敛性。我们的分析消除了误差界中的 εcritic\varepsilon_{\text{critic}} 项,同时仍实现了最佳已知样本复杂度。此外,我们关注具有单一马尔可夫样本轨迹的具有挑战性的单循环设定。我们的主要技术创新在于分析评论家中由策略依赖和时变的相容函数逼近引起的随机偏差,并处理由单一马尔可夫样本轨迹引起的 MDP 的非遍历性。附录中还提供了数值结果。

关键词

引用

@article{arxiv.2406.01762,
  title  = {Non-Asymptotic Analysis for Single-Loop (Natural) Actor-Critic with Compatible Function Approximation},
  author = {Yudan Wang and Yue Wang and Yi Zhou and Shaofeng Zou},
  journal= {arXiv preprint arXiv:2406.01762},
  year   = {2024}
}

备注

ICML 2024