中文

基于耦合值分解的离线多智能体强化学习

机器学习 2023-06-16 v1 多智能体系统

摘要

离线强化学习(RL)从离线数据集学习策略而无需与环境交互,近年来受到相当关注。与单智能体情形下丰富的文献相比,离线多智能体 RL 仍是一个相对未被充分探索的领域。大多数现有方法直接将离线 RL 要素应用于多智能体设定,未充分利用可分解的问题结构,导致在复杂任务中性能不尽如人意。我们提出 OMAC,一种基于耦合值分解的新型离线多智能体 RL 算法。OMAC 采用耦合值分解方案,将全局值函数分解为局部与共享分量,并保持状态值与 Q 值函数之间的信用分配一致性。此外,OMAC 在分解后的局部状态值函数上执行样本内学习,在局部层面隐式进行 max-Q 操作,同时避免由评估分布外动作引起的分布偏移。基于离线多智能体 StarCraft II 微操任务的全面评估,我们展示了 OMAC 优于最先进的离线多智能体 RL 方法。

关键词

引用

@article{arxiv.2306.08900,
  title  = {Offline Multi-Agent Reinforcement Learning with Coupled Value Factorization},
  author = {Xiangsen Wang and Xianyuan Zhan},
  journal= {arXiv preprint arXiv:2306.08900},
  year   = {2023}
}

备注

Accepted by the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023)