中文

缓解多智能体强化学习中的相对过度泛化

机器学习 2024-11-19 v1 人工智能 机器学习

摘要

在去中心化的多智能体强化学习中,智能体孤立学习可能导致相对过度泛化(RO),即最优联合动作被低估,而次优动作被高估。这阻碍了合作任务中的有效协调,因为智能体倾向于选择个体理性但集体次优的动作。为解决此问题,我们引入了MaxMax Q-Learning(MMQ),它采用迭代过程采样和评估潜在的下一状态,并选择具有最大Q值的状态进行学习。这种方法细化了理想状态转移的近似,使其更接近协作智能体的最优联合策略。我们提供了支持MMQ潜力的理论分析,并在多种易受RO影响的环境中进行了实证评估。结果表明,MMQ经常优于现有基线,展现出增强的收敛性和样本效率。

关键词

引用

@article{arxiv.2411.11099,
  title  = {Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning},
  author = {Ting Zhu and Yue Jin and Jeremie Houssineau and Giovanni Montana},
  journal= {arXiv preprint arXiv:2411.11099},
  year   = {2024}
}

备注

Published in Transactions on Machine Learning Research (11/2024)