中文

通过序列得分分解的离线多智能体强化学习

机器学习 2026-05-29 v3 多智能体系统

摘要

离线协作多智能体强化学习(MARL)面临着由分布偏移带来的独特挑战,这尤其源于联合动作空间的高维性以及分布外联合动作选择的存在。在这项工作中,我们强调离线 MARL 的一个根本挑战源于协作任务的多均衡特性,这导致了高度多模态的联合行为策略空间与异质质量的行为数据相结合。这使得个体策略正则化难以与一致的协调模式对齐,从而导致策略分布偏移问题。为应对这一挑战,我们设计了一种序列得分函数分解方法,该方法从联合行为策略中提炼出每个智能体的正则化信号,从而在去中心化执行约束下诱导协调的模式选择。然后,我们利用一个灵活的基于扩散的生成模型从多模态离线数据中学习这些得分函数,并将其集成到联合动作评论家中,以在共享团队奖励下引导策略更新朝向高奖励、分布内的区域。我们的方法在多个粒子环境和多智能体 MuJoCo 基准测试中持续取得了最先进的性能。据我们所知,这是第一个明确解决离线与在线 MARL 之间分布差距的工作,为更泛化的基于离线策略的 MARL 方法铺平了道路。

关键词

引用

@article{arxiv.2505.05968,
  title  = {Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition},
  author = {Dan Qiao and Wenhao Li and Shanchao Yang and Hongyuan Zha and Baoxiang Wang},
  journal= {arXiv preprint arXiv:2505.05968},
  year   = {2026}
}

备注

ICML 2026 Accepted