XP-MARL:用于解决非平稳性的多智能体强化学习中的辅助优先级
机器人学
2024-10-22 v1 计算机科学与博弈论
多智能体系统
摘要
非平稳性是多智能体强化学习(MARL)中的根本性挑战,源于智能体同时学习并改变其策略。这会导致从每个 individual 智能体的角度来看,环境是非平稳的,常常导致次优甚至不收敛的学习结果。我们提出了一个开源框架,名为 XP-MARL,通过辅助优先级来解决解决这一挑战的合作设置。XP-MARL 1) 基于我们关于优先级智能体建立其动作先后顺序,以稳定学习过程从而缓解非平稳性的假设;2) 通过一种称为动作传递的机制实现,其中高优先级智能体先行动并传递其动作,为其他智能体提供更平稳的环境。此外,与使用预定义或启发式优先级分配不同,XP-MARL 通过解决一个辅助 MARL 问题来学习优先级分配策略,形成联合学习方案。在涉及连接和自动驾驶车辆(CAVs)的运动规划场景中的实验表明,XP-MARL 将基线模型的安全性提高了 84.4%,并超过了一种最新方法(该方法仅将基线提高了 12.8%)。代码:github.com/cas-lab-munich/sigmarl
引用
@article{arxiv.2409.11852,
title = {XP-MARL: Auxiliary Prioritization in Multi-Agent Reinforcement Learning to Address Non-Stationarity},
author = {Jianye Xu and Omar Sobhy and Bassam Alrifaee},
journal= {arXiv preprint arXiv:2409.11852},
year = {2024}
}
备注
7 pages, 5 figures. This work has been submitted to the IEEE for possible publication