中文

基于深度确定性策略梯度方法的多车编队控制

机器人学 2018-06-04 v1

摘要

随着多车系统的广泛应用,编队控制已得到广泛研究。本文基于深度强化学习框架,研究了具有避碰和通信保持的多车系统(Multi-vehicles System, MVS)编队控制问题。具体地,采用了具有集中训练与分布式执行过程的深度确定性策略梯度(deep deterministic policy gradient, DDPG)方法来获取编队控制策略。首先,为避免状态观测的动态变化,采用基于三层张量的观测表示,使得尽管观测维度变化,状态仍保持恒定。设计了一种奖励函数以引导航点跟踪、避碰与通信保持,并通过引入邻居的局部奖励函数对该奖励函数进行增强。最后,采用集中训练过程,基于所有智能体间的公共训练集训练共享策略。所提方法在不同设置的仿真场景下进行了测试。

关键词

引用

@article{arxiv.1806.00196,
  title  = {Multi-vehicle Flocking Control with Deep Deterministic Policy Gradient Method},
  author = {Yang Lyu and Quan Pan and Jinwen Hu and Chunhui Zhao and Shuai Liu},
  journal= {arXiv preprint arXiv:1806.00196},
  year   = {2018}
}