中文

逻辑团队 Q 学习:协作式多智能体强化学习中因子化策略的一种途径

机器学习 2021-04-28 v2 人工智能 多智能体系统 系统与控制 系统与控制 机器学习

摘要

我们解决协作式 MARL 场景中学习因子化策略的挑战。具体地,我们考虑一组智能体协作优化公共代价的情况。目标是获得决定每个智能体个体行为的因子化策略,使得由此产生的联合策略最优。本工作的主要贡献是引入逻辑团队 Q 学习 (LTQL)。LTQL 不依赖对环境假设,因此普遍适用于任何协作式 MARL 场景。我们将 LTQL 推导为本文引入的动态规划方法的随机逼近。我们在文末给出(表格与深度两种设定下的)实验来说明上述论断。

关键词

引用

@article{arxiv.2006.03553,
  title  = {Logical Team Q-learning: An approach towards factored policies in cooperative MARL},
  author = {Lucas Cassano and Ali H. Sayed},
  journal= {arXiv preprint arXiv:2006.03553},
  year   = {2021}
}