中文

基于混合人格改进的脉冲 actor 网络用于高效多智能体协作

人工智能 2023-05-11 v1 多智能体系统 神经与进化计算

摘要

自适应的人-智能体与智能体-智能体协作在多智能体强化学习(MARL)研究中正变得愈发关键,借助深度神经网络已取得显著进展。然而,许多已有算法仅在学习范式下表现良好,而在与其他未见伙伴协作时泛化能力差。认知心理学中的人格理论指出,人类通过先预测他人人格再预测其复杂行为来很好地应对上述协作挑战。受这一两步心理学理论启发,我们提出一种具有生物合理性的混合人格(MoP)改进脉冲actor网络(SAN),其中利用行列式点过程模拟MoP中不同类型人格的复杂形成与整合,并将动态与脉冲神经元引入SAN以实现高效强化学习。我们选用对协作烹饪有强需求的基准Overcooked任务来测试所提MoP-SAN。实验结果表明,MoP-SAN不仅在学习范式下,而且在泛化测试(即与其他未见智能体协作)范式下均能取得高性能,而大多数对应的深度actor网络在该泛化测试中失败。我们进行了必要的消融实验与可视化分析,以解释为何MoP与SAN在多智能体强化学习场景中有效,而DNN在泛化测试中表现不佳。

关键词

引用

@article{arxiv.2305.05898,
  title  = {Mixture of personality improved Spiking actor network for efficient multi-agent cooperation},
  author = {Xiyun Li and Ziyi Ni and Jingqing Ruan and Linghui Meng and Jing Shi and Tielin Zhang and Bo Xu},
  journal= {arXiv preprint arXiv:2305.05898},
  year   = {2023}
}

备注

20 pages, 7 figures