PIC:用于多智能体深度强化学习的置换不变评论家
机器学习
2019-11-04 v1 计算机视觉与模式识别
机器学习
摘要
样本效率与向大量智能体扩展的能力是多智能体强化学习系统的两个重要目标。近期的研究通过利用依赖于所有观测与动作的深度网络评论家,从单一智能体视角处理环境的非平稳性,使我们更接近这些目标。该评论家的输入按用户指定顺序拼接智能体的观测与动作。然而,由于深度网络不具备置换不变性,尽管环境保持不变,置换后的输入会改变评论家输出。为避免这一低效问题,我们提出“置换不变评论家”(PIC),其输出不受智能体置换影响而保持一致。这种一致的表示为我们的模型扩展到多 30 倍的智能体提供了可能,并在具有挑战性的多智能体粒子环境(MPE)上取得了 15% 至 50% 的测试回合奖励提升。
引用
@article{arxiv.1911.00025,
title = {PIC: Permutation Invariant Critic for Multi-Agent Deep Reinforcement Learning},
author = {Iou-Jen Liu and Raymond A. Yeh and Alexander G. Schwing},
journal= {arXiv preprint arXiv:1911.00025},
year = {2019}
}
备注
Accepted to CORL2019