基于部分奖励解耦的协作多智能体策略学习
机器学习
2021-12-24 v1 人工智能
机器人学
摘要
将多智能体强化学习扩展到大量智能体的主要障碍之一是为各智能体动作分配信用。本文以我们称之为部分奖励解耦(PRD)的方法解决该信用分配问题,该方法试图将大型协作多智能体 RL 问题分解为涉及智能体子集的解耦子问题,从而简化信用分配。我们经验性地证明,在 actor-critic 算法中使用 PRD 分解 RL 问题可降低策略梯度估计的方差,相较于多种其他 actor-critic 方法,提升了各类多智能体 RL 任务的数据效率、学习稳定性与渐近性能。此外,我们将方法与反事实多智能体策略梯度(COMA,一种最先进的 MARL 算法)相关联,并经验性地表明,我们的方法通过更好利用智能体奖励流中的信息以及使近期优势估计进展得以应用,优于 COMA。
引用
@article{arxiv.2112.12740,
title = {Learning Cooperative Multi-Agent Policies with Partial Reward Decoupling},
author = {Benjamin Freed and Aditya Kapoor and Ian Abraham and Jeff Schneider and Howie Choset},
journal= {arXiv preprint arXiv:2112.12740},
year = {2021}
}
备注
in IEEE Robotics and Automation Letters