基于模型的协作式优先扫描多智能体强化学习
机器学习
2020-01-22 v1 人工智能
多智能体系统
机器学习
摘要
我们提出了一种新的基于模型的强化学习算法——协作式优先扫描(Cooperative Prioritized Sweeping),用于在多智能体马尔可夫决策过程中高效学习。该算法通过利用因子分解来近似价值函数,从而能够在大规模问题上进行样本高效的学习。我们的方法仅需要以动态决策网络形式给出的问题结构知识。利用该信息,我们的方法学习环境模型并执行时序差分更新,这些更新一次性影响多个联合状态与动作。此外还执行批量更新,在因子化 Q 函数中高效地反向传播知识。我们的方法在著名的 SysAdmin 基准测试和随机化环境中均优于最先进的稀疏协作 Q 学习算法(sparse cooperative Q-learning algorithm)。
引用
@article{arxiv.2001.07527,
title = {Model-based Multi-Agent Reinforcement Learning with Cooperative Prioritized Sweeping},
author = {Eugenio Bargiacchi and Timothy Verstraeten and Diederik M. Roijers and Ann Nowé},
journal= {arXiv preprint arXiv:2001.07527},
year = {2020}
}