中文

多智能体离策略 TD 学习:具有近最优样本复杂度与通信复杂度的有限时间分析

机器学习 2021-03-25 v1 多智能体系统 最优化与控制

摘要

离策略 TD 学习的有限时间收敛性近来已被全面研究。然而,在涵盖更广应用且本质上更具挑战性的多智能体设定下,此类收敛性尚未得到很好确立。本文针对马尔可夫采样下的多智能体离策略 TD 学习,开发了两种带修正的分散式 TD(TDC)算法。具体而言,我们的算法保护了智能体的动作、策略与奖励的完全隐私,并采用小批量采样以降低采样方差与通信频率。在马尔可夫采样与线性函数逼近下,我们证明两种算法达到 ϵ\epsilon 精度解的有限时间样本复杂度均为 O(ϵ1lnϵ1)\mathcal{O}(\epsilon^{-1}\ln \epsilon^{-1}) 阶,与集中式 TD(0) 和 TDC 的近最优样本复杂度一致。重要的是,我们算法的通信复杂度为 O(lnϵ1)\mathcal{O}(\ln \epsilon^{-1}) 阶,显著低于现有分散式 TD(0) 的通信复杂度 O(ϵ1lnϵ1)\mathcal{O}(\epsilon^{-1}\ln \epsilon^{-1})。实验证实了我们的理论发现。

关键词

引用

@article{arxiv.2103.13147,
  title  = {Multi-Agent Off-Policy TD Learning: Finite-Time Analysis with Near-Optimal Sample Complexity and Communication Complexity},
  author = {Ziyi Chen and Yi Zhou and Rongrong Chen},
  journal= {arXiv preprint arXiv:2103.13147},
  year   = {2021}
}

备注

34 pages, 3 figures