逻辑团队 Q 学习:协作式多智能体强化学习中因子化策略的一种途径
机器学习
2021-04-28 v2 人工智能
多智能体系统
系统与控制
系统与控制
机器学习
摘要
我们解决协作式 MARL 场景中学习因子化策略的挑战。具体地,我们考虑一组智能体协作优化公共代价的情况。目标是获得决定每个智能体个体行为的因子化策略,使得由此产生的联合策略最优。本工作的主要贡献是引入逻辑团队 Q 学习 (LTQL)。LTQL 不依赖对环境假设,因此普遍适用于任何协作式 MARL 场景。我们将 LTQL 推导为本文引入的动态规划方法的随机逼近。我们在文末给出(表格与深度两种设定下的)实验来说明上述论断。
引用
@article{arxiv.2006.03553,
title = {Logical Team Q-learning: An approach towards factored policies in cooperative MARL},
author = {Lucas Cassano and Ali H. Sayed},
journal= {arXiv preprint arXiv:2006.03553},
year = {2021}
}