中文

面向异构团队的强化学习及其 PALO 界

机器学习 2020-11-19 v1 人工智能 机器学习

摘要

我们提出了面向异构团队的强化学习,其中每个智能体的奖励可加性分解为局部代价、各智能体独有的刺激以及全局奖励(即该领域中所有智能体共享的奖励)。其动机领域包括多种机器人平台的协调,这些平台对同一动作产生不同代价,但共享总体目标。我们针对这种具有分解奖励的设置给出了两种学习模板:一是将 Perkins 的蒙特卡洛探索起点(Monte Carlo exploring starts)从 POMDP 推广到标准 MPOMDP,采用单一策略将所有智能体的联合观测映射到联合动作(MCES-MP);另一种是每个智能体将联合观测分别映射到自身动作(MCES-FMP)。我们利用可能近似局部最优(PALO)界分析样本复杂度,并将这些模板实例化为 PALO 学习。我们通过引入策略空间剪枝技术提升样本效率,并在三个异构智能体域上评估了这些方法,表明与 MCES-MP 及先前基准相比,MCES-FMP 以更少样本得到了更优策略。

关键词

引用

@article{arxiv.1805.09267,
  title  = {Reinforcement Learning for Heterogeneous Teams with PALO Bounds},
  author = {Roi Ceren and Prashant Doshi and Keyang He},
  journal= {arXiv preprint arXiv:1805.09267},
  year   = {2020}
}