中文

基于生成流网络的多智能体连续控制

人工智能 2024-08-14 v1 多智能体系统

摘要

生成流网络 (GFlowNets) 旨在从轨迹最终状态与奖励成比例的分布中生成多样化轨迹,作为探索性控制任务中强化学习的强大替代方案。然而,GFlowNets 中的单流匹配约束限制了其在多智能体系统中的应用,尤其是连续联合控制问题。本文提出了一种新颖的多智能体生成连续流网络 (MACFN) 方法,使多个智能体能够对各种组合连续对象进行协作探索。技术上,MACFN 以集中式全局流匹配的方式训练基于单流的去中心化策略。在集中式训练期间,MACFN 引入了一个连续流分解网络,在仅有全局奖励的情况下推断每个智能体的流贡献。随后,智能体可仅基于分配的局部流以去中心化方式输出动作,形成与奖励成比例的联合策略分布。为保证连续流分解的表达能力,我们在理论上推导了分解网络的一致性条件。实验结果表明,所提方法优于现有最先进方法,并具有更强的探索能力。代码地址:https://github.com/isluoshuang/MACFN。

关键词

引用

@article{arxiv.2408.06920,
  title  = {Multi-Agent Continuous Control with Generative Flow Networks},
  author = {Shuang Luo and Yinchuan Li and Shunyu Liu and Xu Zhang and Yunfeng Shao and Chao Wu},
  journal= {arXiv preprint arXiv:2408.06920},
  year   = {2024}
}