中文

通过仿真与图卷积网络学习协作与在线规划

人工智能 2021-10-19 v1

摘要

多智能体马尔可夫决策过程 (MMDP) 一直是为多智能体协作环境建模序贯决策算法的有效方式。该领域内已发展出若干基于集中式与分散式规划的算法。然而,动态变化的环境,加上状态与联合动作空间的指数级规模,使这些算法难以同时提供效率与可扩展性。近来,集中式规划算法 FV-MCTS-MP 与分散式规划算法 \textit{Alternate maximization with Behavioural Cloning} (ABC) 在求解 MMDP 上取得了显著性能。但它们分别无法适应动态变化环境以及无法解决智能体间缺乏通信的问题。在此背景下,我们引入一种基于仿真的在线规划算法,称为 SiCLOP,用于多智能体协作环境。具体而言,SiCLOP 定制了蒙特卡洛树搜索 (MCTS) 并利用协调图 (CG) 与图神经网络 (GCN) 学习协作,提供 MMDP 问题的实时求解。它还通过对动作空间的有效剪枝改善了可扩展性。此外,不同于 FV-MCTS-MP 与 ABC,SiCLOP 支持迁移学习,使学习到的智能体能在不同环境中运行。我们还给出了在多重智能体设定下关于算法收敛性质的理论讨论。最后,我们大量的实证结果表明 SiCLOP 显著优于最先进的在线规划算法。

关键词

引用

@article{arxiv.2110.08480,
  title  = {Learning Cooperation and Online Planning Through Simulation and Graph Convolutional Network},
  author = {Rafid Ameer Mahmud and Fahim Faisal and Saaduddin Mahmud and Md. Mosaddek Khan},
  journal= {arXiv preprint arXiv:2110.08480},
  year   = {2021}
}