QTRAN:通过变换学习因式分解用于合作多智能体强化学习
机器学习
2019-05-15 v1 人工智能
多智能体系统
机器学习
摘要
我们探索近期流行的集中训练与分散执行(CTDE)机制下多智能体强化学习(MARL)任务基于值的解决方案。然而,VDN 和 QMIX 是使用将联合动作值函数因式分解为个体函数以实现分散执行的代表性例子。由于其在因式分解中的结构性约束(如可加性和单调性),VDN 和 QMIX 仅能处理可因式分解 MARL 任务的一部分。在本文中,我们提出一种新的 MARL 因式分解方法 QTRAN,它不受此类结构约束限制,并采用新方法将原始联合动作值函数转换为易于因式分解的函数,同时保持相同的最优动作。QTRAN 保证了比 VDN 或 QMIX 更一般的因式分解,从而比先前方法覆盖更广泛类别的 MARL 任务。我们在多域高斯挤压和修改的捕食者-猎物任务上的实验证明了 QTRAN 的优越性能,尤其在惩罚非合作行为更严厉的对局中优势更大。
引用
@article{arxiv.1905.05408,
title = {QTRAN: Learning to Factorize with Transformation for Cooperative Multi-Agent Reinforcement Learning},
author = {Kyunghwan Son and Daewoo Kim and Wan Ju Kang and David Earl Hostallero and Yung Yi},
journal= {arXiv preprint arXiv:1905.05408},
year = {2019}
}
备注
18 pages; Accepted to ICML 2019