中文

在深度强化学习中利用学习智能体间的通信拓扑

机器学习 2020-03-16 v2 机器学习

摘要

在深度强化学习(DRL)和许多其他机器学习算法中,一种常见的提升学习性能的技术是并行运行多个学习智能体。在这些算法的发展中,一个被忽视的环节是如何最佳地安排所涉及的学习智能体以改善分布式搜索。在此,我们借鉴网络优化文献中的结果,其表明将学习智能体安排在完全连接拓扑(智能体通常隐含采用的排列方式)以外的通信网络中能够改善学习。我们探究了四类流行图结构的相对性能,并观察到其中一类(Erdos-Renyi随机图)在多个DRL基准任务上经验性地优于事实上的完全连接通信拓扑。此外,我们观察到排列在Erdos-Renyi图中的1000个学习智能体可取得与排列在标准完全连接拓扑中的3000个智能体相当的性能,表明精心设计与智能体通信所用的拓扑可带来巨大的学习提升。我们以对这些替代拓扑为何表现更优的理论探究补充了上述经验结果。总体而言,我们的工作表明,若优化学习智能体间的通信拓扑,分布式机器学习算法可变得更加有效。

关键词

引用

@article{arxiv.1902.06740,
  title  = {Leveraging Communication Topologies Between Learning Agents in Deep Reinforcement Learning},
  author = {Dhaval Adjodah and Dan Calacci and Abhimanyu Dubey and Anirudh Goyal and Peter Krafft and Esteban Moro and Alex Pentland},
  journal= {arXiv preprint arXiv:1902.06740},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:1811.12556