多智能体系统中独立学习的近似全局收敛
机器学习
2024-05-31 v1 多智能体系统
摘要
独立学习(IL)尽管在实践中是实现在大规模多智能体系统中可扩展性的流行方法,但通常缺乏全局收敛保证。在本文中,我们研究了基于价值和基于策略框架下的两种代表性算法:独立Q学习和独立自然演员-评论家,并提供了近似全局收敛的首个有限样本分析。结果表明,样本复杂度为,加上一个误差项,该误差项捕捉了智能体之间的依赖性,并刻画了IL在实现全局收敛方面的基本极限。为了建立该结果,我们开发了一种分析IL的新方法,通过构造一个可分离的马尔可夫决策过程(MDP)进行收敛分析,然后界定了可分离MDP与原始MDP之间由于模型差异导致的差距。此外,我们使用合成MDP和电动汽车充电示例进行了数值实验,以验证我们的理论发现并展示IL的实际适用性。
引用
@article{arxiv.2405.19811,
title = {Approximate Global Convergence of Independent Learning in Multi-Agent Systems},
author = {Ruiyang Jin and Zaiwei Chen and Yiheng Lin and Jie Song and Adam Wierman},
journal= {arXiv preprint arXiv:2405.19811},
year = {2024}
}