基于近似同步优势估计的多智能体策略优化
机器学习
2021-05-11 v3 人工智能
摘要
协作多智能体任务要求智能体在共享全局奖励下推断各自贡献,即信用分配挑战。解决该挑战的基于策略的多智能体强化学习通用方法为各智能体引入差异化值函数或优势函数。在多智能体系统中,不同智能体的策略需联合评估。为同步更新策略,此类值函数或优势函数也需同步评估。然而,在当前方法中,值函数或优势函数使用反事实联合动作,其评估是异步的,因此存在天然的估计偏差。本文中,我们提出近似同步优势估计。我们首先推导出边际优势函数,作为从单智能体优势函数到多智能体系统的扩展。进一步,我们引入一种用于同步优势估计的策略近似,并将多智能体策略优化问题分解为多个单智能体策略优化子问题。我们的方法在 StarCraft 多智能体挑战上与基线算法比较,并在大多数任务上展现出最优性能。
引用
@article{arxiv.2012.03488,
title = {Multi-agent Policy Optimization with Approximatively Synchronous Advantage Estimation},
author = {Lipeng Wan and Xuwei Song and Xuguang Lan and Nanning Zheng},
journal= {arXiv preprint arXiv:2012.03488},
year = {2021}
}