中文

有向无环图约束下多协调智能体的强化学习

机器学习 2023-07-18 v1 人工智能 多智能体系统

摘要

本文提出一种新颖的多智能体强化学习(MARL)方法,用于在有向无环图(DAG)约束下学习多个协调智能体。与现有 MARL 方法不同,我们的方法显式利用智能体间的 DAG 结构以实现更有效的学习性能。在理论上,我们基于带合成奖励的 MARL 模型(MARLM-SR)提出一种新颖的替代值函数,并证明其作为最优值函数的下界。在计算上,我们提出一种实用训练算法,其利用领导者智能体以及奖励生成与分发智能体的新概念,以引导被分解的跟随者智能体在具 DAG 约束的环境中更好地探索参数空间。在实验上,我们利用四个 DAG 环境(包括 Intel 某高产量封装与测试工厂的真实调度)来基准测试我们的方法,并显示其优于其他非 DAG 方法。

关键词

引用

@article{arxiv.2307.07529,
  title  = {Learning Multiple Coordinated Agents under Directed Acyclic Graph Constraints},
  author = {Jaeyeon Jang and Diego Klabjan and Han Liu and Nital S. Patel and Xiuqi Li and Balakrishnan Ananthanarayanan and Husam Dauod and Tzung-Han Juang},
  journal= {arXiv preprint arXiv:2307.07529},
  year   = {2023}
}