多智能体价值分解中的冗余性挑战
人工智能
2023-04-04 v1
摘要
在协作多智能体强化学习(MARL)领域,标准范式是采用集中训练与分散执行,其中中央评论员基于中央状态调节协作智能体的策略。研究表明,在存在大量冗余智能体的情形下,这些方法的有效性下降。更一般地,环境中智能体数量很可能超出解决任务所需。这些冗余智能体通过扩大状态空间维度并增大用于求解环境的联合策略规模而降低性能。我们提出利用逐层相关性传播(LRP)来分离联合价值函数的学习与局部奖励信号的生成,并创建一种新的MARL算法:相关性分解网络(RDN)。我们发现,尽管基线VDN与Qmix的性能随冗余智能体数量增多而退化,RDN却不受影响。
引用
@article{arxiv.2304.00009,
title = {The challenge of redundancy on multi-agent value factorisation},
author = {Siddarth Singh and Benjamin Rosman},
journal= {arXiv preprint arXiv:2304.00009},
year = {2023}
}
备注
Published at the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023). 2 Pages, 1 Figure