多智能体离策略 TD 学习:具有近最优样本复杂度与通信复杂度的有限时间分析
机器学习
2021-03-25 v1 多智能体系统
最优化与控制
摘要
离策略 TD 学习的有限时间收敛性近来已被全面研究。然而,在涵盖更广应用且本质上更具挑战性的多智能体设定下,此类收敛性尚未得到很好确立。本文针对马尔可夫采样下的多智能体离策略 TD 学习,开发了两种带修正的分散式 TD(TDC)算法。具体而言,我们的算法保护了智能体的动作、策略与奖励的完全隐私,并采用小批量采样以降低采样方差与通信频率。在马尔可夫采样与线性函数逼近下,我们证明两种算法达到 精度解的有限时间样本复杂度均为 阶,与集中式 TD(0) 和 TDC 的近最优样本复杂度一致。重要的是,我们算法的通信复杂度为 阶,显著低于现有分散式 TD(0) 的通信复杂度 。实验证实了我们的理论发现。
引用
@article{arxiv.2103.13147,
title = {Multi-Agent Off-Policy TD Learning: Finite-Time Analysis with Near-Optimal Sample Complexity and Communication Complexity},
author = {Ziyi Chen and Yi Zhou and Rongrong Chen},
journal= {arXiv preprint arXiv:2103.13147},
year = {2021}
}
备注
34 pages, 3 figures