中文

基于值函数近似的策略梯度方法用于集体多智能体规划

人工智能 2018-04-11 v1 机器学习 多智能体系统 神经与进化计算 系统与控制

摘要

分散式(PO)MDP 为多智能体系统中的序贯决策提供了一个极具表达力的框架。鉴于其计算复杂性,近期研究聚焦于可处理且实用的 Dec-POMDP 子类。我们研究其中一类称为 CDEC-POMDP 的子类,其中智能体群体的集体行为影响联合奖励与环境动力学。我们的主要贡献是一种用于优化 CDEC-POMDP 策略的 actor-critic(AC)强化学习方法。朴素 AC 在较大问题上收敛缓慢。为此,我们展示了如何将近似动作值函数按智能体特定分解可带来有效更新,并推导出一种基于局部奖励信号训练评论者(critic)的新方法。在一个合成基准和一个真实世界的出租车车队优化问题上的比较表明,我们新的 AC 方法比以往最优方法提供了更高质量的求解。

关键词

引用

@article{arxiv.1804.02884,
  title  = {Policy Gradient With Value Function Approximation For Collective Multiagent Planning},
  author = {Duc Thien Nguyen and Akshat Kumar and Hoong Chuin Lau},
  journal= {arXiv preprint arXiv:1804.02884},
  year   = {2018}
}