通过局部TD更新实现样本和通信高效的完全去中心化MARL策略评估
机器学习
2024-03-26 v1 多智能体系统
摘要
在完全去中心化多智能体强化学习(MARL)的actor-critic框架中,关键组件之一是MARL策略评估(PE)问题,其中一组N个智能体通过与其邻居通信,协作评估给定策略下全局状态的价值函数。在MARL-PE中,一个关键挑战是如何降低样本复杂度和通信复杂度,它们定义为收敛到某个ε-驻点所需的训练样本数和通信轮数。为了降低MARL-PE中的通信复杂度,一个“自然”的想法是在每轮通信之间执行多次局部TD更新步骤以减少通信频率。然而,由于智能体间奖励异质性导致的潜在“智能体漂移”现象,局部TD更新方法的有效性仍不清楚。这引出一个有趣的问题:局部TD更新方法能否实现低样本和通信复杂度?在本文中,我们首次尝试回答这个基本问题。我们关注平均奖励的MARL-PE设置,这受到许多多智能体网络优化问题的启发。我们的理论和实验结果表明,与基于共识的MARL-PE算法相比,允许多次局部TD更新步骤确实是降低MARL-PE样本和通信复杂度的有效方法。具体地,为了收敛到MARL-PE的ε-驻点,两次连续通信之间的局部TD更新步骤可以多达O(1/ε^{1/2} log(1/ε))。此外,我们理论上表明,为了达到最优样本复杂度,局部TD更新方法的通信复杂度为O(1/ε^{1/2} log(1/ε))。
引用
@article{arxiv.2403.15935,
title = {Sample and Communication Efficient Fully Decentralized MARL Policy Evaluation via a New Approach: Local TD update},
author = {Fnu Hairi and Zifan Zhang and Jia Liu},
journal= {arXiv preprint arXiv:2403.15935},
year = {2024}
}
备注
Main body of the paper appeared in AAMAS24