中文

全分散单时间尺度 Actor-Critic 的有限时间分析

机器学习 2023-01-31 v2 人工智能

摘要

分散式 Actor-Critic(AC)算法已广泛用于多智能体强化学习(MARL)并取得了显著成功。除经验上的成功外,分散式 AC 算法的理论收敛性质在很大程度上未被探索。现有有限时间收敛结果大多基于双循环更新或双时间尺度步长规则推导,即便在单智能体设定下的集中式 AC 算法也是如此。在实践中,单时间尺度更新被广泛使用,其中 actor 与 critic 以相同量级步长交替更新。本工作中,我们研究一种分散式单时间尺度 AC 算法。理论上,利用线性逼近进行值与奖励估计,我们证明该算法在马尔可夫采样下具有 O~(ε2)\tilde{\mathcal{O}}(\varepsilon^{-2}) 的样本复杂度,与双循环实现的最优复杂度一致(此处 O~\tilde{\mathcal{O}} 隐藏了对数项)。当退化为单智能体设定时,我们的结果为采用单时间尺度更新方案的集中式 AC 给出了新的样本复杂度。建立我们复杂度结果的核心是我们所揭示的最优 critic 变量的隐藏光滑性。我们还提供了算法的局部动作隐私保护版本及其分析。最后,我们开展实验以展示本算法相对于现有分散式 AC 算法的优越性。

关键词

引用

@article{arxiv.2206.05733,
  title  = {Finite-Time Analysis of Fully Decentralized Single-Timescale Actor-Critic},
  author = {Qijun Luo and Xiao Li},
  journal= {arXiv preprint arXiv:2206.05733},
  year   = {2023}
}

备注

accepted for publication in Transactions on Machine Learning Research