中文

谱归一化在多智能体强化学习中的影响

机器学习 2023-04-21 v2 人工智能

摘要

可靠的评论家是基于策略的 actor-critic 学习的核心。但在多智能体稀疏奖励场景中,由于两个因素,学习可靠的评论家变得困难:1) 联合动作空间随智能体数量呈指数增长;2) 这一点结合奖励稀疏性与环境噪声,导致准确学习需要大量样本。我们表明,用谱归一化(SN)正则化评论家可使其更鲁棒地学习,即便在多智能体基于策略的稀疏奖励场景中亦如此。我们的实验显示,正则化后的评论家能在复杂的 SMAC 与 RWARE 域中快速从稀疏奖励经验中学习。这些发现凸显了评论家正则化对于稳定学习的重要性。

关键词

引用

@article{arxiv.2212.05331,
  title  = {Effects of Spectral Normalization in Multi-agent Reinforcement Learning},
  author = {Kinal Mehta and Anuj Mahajan and Pawan Kumar},
  journal= {arXiv preprint arXiv:2212.05331},
  year   = {2023}
}

备注

Accepted at IJCNN-2023