利用带奖励塑形的强化学习进行避障与导航
机器人学
2020-04-13 v2 机器学习
系统与控制
系统与控制
摘要
本文中,我们研究机器人控制领域的避障与导航问题。为解决该问题,我们提出了改进的深层确定性策略梯度(DDPG)和近端策略优化算法,并采用一种改进的奖励塑形技术。我们在真实移动机器人的仿真上将原始 DDPG 和 PPO 与两者的改进版本进行性能比较,并证明所提算法取得了更好的结果。
引用
@article{arxiv.2003.12863,
title = {Obstacle Avoidance and Navigation Utilizing Reinforcement Learning with Reward Shaping},
author = {Daniel Zhang and Colleen P. Bailey},
journal= {arXiv preprint arXiv:2003.12863},
year = {2020}
}