基于层级导体的多智能体强化学习策略优化(HCPO)
机器学习
2025-11-18 v1
摘要
在合作多智能体强化学习(MARL)中,高效的探索对于优化联合策略性能至关重要。然而,现有方法通常通过独立的智能体探索来更新联合策略,缺乏智能体之间的协调,这本质上限制了联合策略的表达能力和探索范围。为此,本文提出一种基于导体的联合策略框架,直接增强联合策略的表达能力并协调探索。此外,我们发展了一种层级导体策略优化(HCPO)算法,该算法按照与性能改进方向一致的方向指示策略更新导体和智能体。我们进一步通过严格的理论保证,建立了联合策略优化过程的单调性。通过部署局部导体,HCPO保持了集中训练的优势,同时消除了执行期间的智能体间通信。最后,我们在三个具有挑战性的基准测试上评估了HCPO:星际争霸II多智能体挑战、多智能体MuJoCo和多智能体粒子环境。结果表明,HCPO在合作效率和稳定性方面优于竞争性MARL基线。
引用
@article{arxiv.2511.12123,
title = {HCPO: Hierarchical Conductor-Based Policy Optimization in Multi-Agent Reinforcement Learning},
author = {Zejiao Liu and Junqi Tu and Yitian Hong and Luolin Xiong and Yaochu Jin and Yang Tang and Fangfei Li},
journal= {arXiv preprint arXiv:2511.12123},
year = {2025}
}
备注
AAAI 2026