中文

基于模型的协作式优先扫描多智能体强化学习

机器学习 2020-01-22 v1 人工智能 多智能体系统 机器学习

摘要

我们提出了一种新的基于模型的强化学习算法——协作式优先扫描(Cooperative Prioritized Sweeping),用于在多智能体马尔可夫决策过程中高效学习。该算法通过利用因子分解来近似价值函数,从而能够在大规模问题上进行样本高效的学习。我们的方法仅需要以动态决策网络形式给出的问题结构知识。利用该信息,我们的方法学习环境模型并执行时序差分更新,这些更新一次性影响多个联合状态与动作。此外还执行批量更新,在因子化 Q 函数中高效地反向传播知识。我们的方法在著名的 SysAdmin 基准测试和随机化环境中均优于最先进的稀疏协作 Q 学习算法(sparse cooperative Q-learning algorithm)。

关键词

引用

@article{arxiv.2001.07527,
  title  = {Model-based Multi-Agent Reinforcement Learning with Cooperative Prioritized Sweeping},
  author = {Eugenio Bargiacchi and Timothy Verstraeten and Diederik M. Roijers and Ann Nowé},
  journal= {arXiv preprint arXiv:2001.07527},
  year   = {2020}
}