集中训练与分散执行框架对多智能体强化学习而言足够集中吗?
人工智能
2025-05-14 v2 机器学习
多智能体系统
摘要
集中训练与分散执行(CTDE)近来成为协作式多智能体强化学习(MARL)的流行框架,其中智能体可使用额外全局状态信息以集中方式指导训练,并仅基于分散局部策略做出自身决策。尽管取得了令人鼓舞的结果,CTDE 对智能体策略做了独立性假设,限制了智能体在集中训练期间相互采用全局协作信息。因此,我们认为现有 CTDE 方法无法充分利用全局信息进行训练,导致低效的联合策略探索甚至次优结果。本文中,我们引入一种新颖的集中建议与分散剪枝(CADP)框架用于多智能体强化学习,其不仅在训练期间实现智能体间有效消息交换,也保证执行的独立策略。首先,CADP 赋予智能体显式通信信道以向不同智能体寻求并接受建议,实现更集中的训练。为进一步确保分散执行,我们提出平滑模型剪枝机制,逐步将智能体通信约束为封闭形式而不降低协作能力。在 StarCraft II 微管理和 Google Research Football 基准上的实证评估表明,所提框架相比最先进同类方法取得更优性能。我们的代码将公开可用。
引用
@article{arxiv.2305.17352,
title = {Is Centralized Training with Decentralized Execution Framework Centralized Enough for MARL?},
author = {Yihe Zhou and Shunyu Liu and Yunpeng Qing and Kaixuan Chen and Tongya Zheng and Jie Song and Mingli Song},
journal= {arXiv preprint arXiv:2305.17352},
year = {2025}
}