保留次优动作以适应多智能体强化学习中的移动最优解
人工智能
2026-05-21 v2
摘要
价值分解是合作多智能体强化学习(MARL)的核心方法之一。然而,现有方法仍依赖单一最优动作,在训练期间价值函数发生变化时难以适应,常收敛至次优策略。为此,我们提出Successive Sub-value Q-learning(S2Q),通过学习多个子价值函数来保留备选高价值动作。将这些子价值函数纳入基于Softmax的行为策略中,S2Q鼓励持续探索,使Q总值能够快速适应变化的最优解。在具有挑战性的MARL基准测试上进行的实验表明,S2Q consistently优于各种MARL算法,显示出 improved的适应性和整体性能。我们的代码可在https://github.com/hyeon1996/S2Q获取。
引用
@article{arxiv.2602.17062,
title = {Retaining Suboptimal Actions to Follow Shifting Optima in Multi-Agent Reinforcement Learning},
author = {Yonghyeon Jo and Sunwoo Lee and Seungyul Han},
journal= {arXiv preprint arXiv:2602.17062},
year = {2026}
}
备注
10 technical page followed by references and appendix. Accepted to ICLR 2026