中文

用于多智能体强化学习中值函数分解的残差 Q 网络

机器学习 2022-05-31 v1 多智能体系统

摘要

多智能体强化学习(MARL)在许多需要多个智能体合作与协调的问题中有用。在多智能体设定下使用强化学习学习最优策略会随智能体数量增加变得十分困难。近期方案如值分解网络(VDN)、QMIX、QTRAN 与 QPLEX 遵循集中训练与分散执行方案并对联合动作值函数进行分解。然而,这些方法仍受环境复杂度增加所困,且有时无法稳定收敛。我们提出一种用于 MARL 的残差 Q 网络(RQN)新概念,其学习以保留个体-全局-最大准则(IGM)的方式变换个体 Q 值轨迹,但在分解动作值函数上更鲁棒。RQN 作为辅助网络加速收敛,并随智能体达到训练目标而变得 obsolete。所提方法性能在系列多智能体合作任务中与 QPLEX、QMIX、QTRAN 与 VDN 等若干 SOTA 技术比较。结果表明所提方法通常收敛更快、稳定性更高,并在更广环境族中展现鲁棒性能。在对非合作行为施以严厉惩罚且尤其训练期缺乏完整状态信息的环境中,结果改进更为显著。

关键词

引用

@article{arxiv.2205.15245,
  title  = {Residual Q-Networks for Value Function Factorizing in Multi-Agent Reinforcement Learning},
  author = {Rafael Pina and Varuna De Silva and Joosep Hook and Ahmet Kondoz},
  journal= {arXiv preprint arXiv:2205.15245},
  year   = {2022}
}

备注

Accepted for publication on IEEE Transactions on Neural Networks and Learning Systems