谱归一化在多智能体强化学习中的影响
机器学习
2023-04-21 v2 人工智能
摘要
可靠的评论家是基于策略的 actor-critic 学习的核心。但在多智能体稀疏奖励场景中,由于两个因素,学习可靠的评论家变得困难:1) 联合动作空间随智能体数量呈指数增长;2) 这一点结合奖励稀疏性与环境噪声,导致准确学习需要大量样本。我们表明,用谱归一化(SN)正则化评论家可使其更鲁棒地学习,即便在多智能体基于策略的稀疏奖励场景中亦如此。我们的实验显示,正则化后的评论家能在复杂的 SMAC 与 RWARE 域中快速从稀疏奖励经验中学习。这些发现凸显了评论家正则化对于稳定学习的重要性。
引用
@article{arxiv.2212.05331,
title = {Effects of Spectral Normalization in Multi-agent Reinforcement Learning},
author = {Kinal Mehta and Anuj Mahajan and Pawan Kumar},
journal= {arXiv preprint arXiv:2212.05331},
year = {2023}
}
备注
Accepted at IJCNN-2023