中文

利用带奖励塑形的强化学习进行避障与导航

机器人学 2020-04-13 v2 机器学习 系统与控制 系统与控制

摘要

本文中,我们研究机器人控制领域的避障与导航问题。为解决该问题,我们提出了改进的深层确定性策略梯度(DDPG)和近端策略优化算法,并采用一种改进的奖励塑形技术。我们在真实移动机器人的仿真上将原始 DDPG 和 PPO 与两者的改进版本进行性能比较,并证明所提算法取得了更好的结果。

关键词

引用

@article{arxiv.2003.12863,
  title  = {Obstacle Avoidance and Navigation Utilizing Reinforcement Learning with Reward Shaping},
  author = {Daniel Zhang and Colleen P. Bailey},
  journal= {arXiv preprint arXiv:2003.12863},
  year   = {2020}
}