中文

吸收态在多智能体强化学习中的使用与误用

机器学习 2022-06-08 v2 人工智能

摘要

在协作式多智能体强化学习(MARL)中,智能体的生成与销毁是一个被严重忽视的研究领域。当前的 MARL 算法通常假设一组内智能体的数量在实验过程中保持固定。然而,在许多实际问题中,某个智能体可能先于其队友终止。这一早期终止问题带来一个挑战:已终止的智能体必须在其自身存在期之外,从整个组的成功或失败中学习。我们将剩余队友所获奖励向已终止智能体传播价值的过程称为死后信用分配(Posthumous Credit Assignment)问题。当前 MARL 方法通过将这类智能体置于吸收态,直至整组智能体达到终止条件来处理该问题。尽管吸收态使现有算法与 API 无需修改即可处理已终止智能体,但在实际训练效率与资源使用方面仍存在隐患。本工作中,我们首先在一个全连接网络的玩具监督学习任务中证明,样本复杂度随吸收态数量增加而上升,而注意力机制对变长输入更具鲁棒性。随后,我们为现有一种最先进的 MARL 算法提出了一种新颖架构,其使用注意力而非带吸收态的全连接层。最后,我们证明该新颖架构在智能体于回合内被生成或销毁的任务以及标准多智能体协调任务上均显著优于标准架构。

关键词

引用

@article{arxiv.2111.05992,
  title  = {On the Use and Misuse of Absorbing States in Multi-agent Reinforcement Learning},
  author = {Andrew Cohen and Ervin Teng and Vincent-Pierre Berges and Ruo-Ping Dong and Hunter Henry and Marwan Mattar and Alexander Zook and Sujoy Ganguly},
  journal= {arXiv preprint arXiv:2111.05992},
  year   = {2022}
}

备注

RL in Games Workshop AAAI 2022