中文

具有可满足性准则的多智能体马尔可夫决策过程的分散式Q学习

系统与控制 2023-11-22 v1 机器学习 多智能体系统 系统与控制

摘要

在本文中,我们提出一种强化学习算法来求解多智能体马尔可夫决策过程(MMDP)。受Blackwell可逼近性定理启发,目标是将每个智能体的时间平均代价降低到预先指定的智能体特定界以下。对于该MMDP,我们假设状态动态由智能体的联合动作控制,但各阶段代价仅依赖于单个智能体的动作。我们将针对每个智能体代价的加权组合的Q学习算法,与采用Metropolis-Hastings或乘性权重形式以调节 gossip 平均矩阵的 gossip 算法相结合。我们在算法中使用多重时间尺度,并证明在温和条件下,它近似实现了各智能体所需的界。我们还在具有联合控制各阶段代价的更一般MMDP设定下展示了该算法的经验性能。

关键词

引用

@article{arxiv.2311.12613,
  title  = {Decentralised Q-Learning for Multi-Agent Markov Decision Processes with a Satisfiability Criterion},
  author = {Keshav P. Keval and Vivek S. Borkar},
  journal= {arXiv preprint arXiv:2311.12613},
  year   = {2023}
}