中文

将NGU扩展至多智能体强化学习:初步研究

人工智能 2025-12-02 v1 机器学习

摘要

Never Give Up (NGU)算法通过结合逃逸新奇性和内在动机,在稀疏奖励的强化学习任务中取得了良好效果。在本工作中,我们将NGU扩展到多智能体环境,并在PettingZoo套件中的simple_tag环境中进行评估。相对于多智能体DQN基线,NGU实现了 moderately 更高的收益和更稳定的学习动力学。我们研究了三个设计选择:(1)共享回放缓冲区与各自的回放缓冲区;(2)使用不同k阈值在智能体之间共享逃逸新奇性;(3)使用不同的beta参数值。我们的结果表明,采用共享回放缓冲区的NGU表现最佳且最稳定,凸显了结合NGU内在探索与经验共享所带来的收益。新奇性共享在k=1时表现相当,但对于较大的k值会损害学习效果。最后,异构的beta值未能超过小的统一值。这些发现表明,在经验共享且内在探索信号经过精心调谋时,NGU可以有效应用于多智能体环境。

关键词

引用

@article{arxiv.2512.01321,
  title  = {Extending NGU to Multi-Agent RL: A Preliminary Study},
  author = {Juan Hernandez and Diego Fernández and Manuel Cifuentes and Denis Parra and Rodrigo Toro Icarte},
  journal= {arXiv preprint arXiv:2512.01321},
  year   = {2025}
}

备注

9 pages, 4 figures, 1 table. Accepted at the LatinX in AI (LXAI) Workshop at NeurIPS 2025. Includes experimental results for Multi-NGU and Multi-DQN in the PettingZoo simple_tag environment