中文

关于利用少量正样本经验求解合作多智能体强化学习问题

机器学习 2020-01-23 v1 人工智能 多智能体系统

摘要

合作多智能体强化学习(MARL)对于搜索救援、无人机监视、包裹递送和消防等问题等众多领域中的合作式分散决策学习至关重要。在这些领域中,一个关键挑战是利用少量正样本经验进行学习,即仅在少数情形下获得正强化(例如扑灭火灾、追踪犯罪或递送包裹),而在大多数其他情形中为零或负强化。在合作 MARL 问题中利用少量正样本经验学习极为困难,原因有三:首先,相较于单智能体情形,探索更困难,因为需协调多个智能体以获得正样本经验;其次,环境非平稳,因为所有智能体同时学习(从而改变策略);第三,问题规模随每个新增智能体显著增长。相关已有工作广泛,且聚焦于处理单智能体 RL 问题中的少量正样本经验,或处理 MARL 问题中非平稳性的可扩展方法。遗憾的是,这些方法(或其扩展)均不能有效解决稀疏正样本经验问题。因此,我们提出一种新颖的虚构自我模仿方法,能够以可扩展方式同时处理非平稳性与稀疏正样本经验。最后,我们针对相关合作 MARL 算法进行了详尽比较(实验性或描述性)以展示本方法的效用。

关键词

引用

@article{arxiv.2001.07993,
  title  = {On Solving Cooperative MARL Problems with a Few Good Experiences},
  author = {Rajiv Ranjan Kumar and Pradeep Varakantham},
  journal= {arXiv preprint arXiv:2001.07993},
  year   = {2020}
}