基于稠密奖励阶段激励机制深度强化学习的机械臂轨迹规划
人工智能
2021-05-25 v2 机器学习
机器人学
摘要
(本工作已提交至 IEEE 以备可能发表。版权可能在未通知的情况下转让,此后此版本可能不再可访问。)为提高基于深度强化学习(DRL)的随机工作环境下机械臂轨迹规划方法的效率,我们提出三种稠密奖励函数。这些奖励不同于传统的稀疏奖励。首先,提出姿态奖励函数,通过建模距离与方向约束,以更合理的轨迹加快学习过程,从而减少探索的盲目性。其次,提出步幅奖励函数,通过建模关节约束的距离与移动距离来提高学习过程的稳定性。最后,为进一步提高学习效率,受人类行为认知过程启发,提出一种阶段激励机制,包括硬阶段激励奖励函数与软阶段激励奖励函数。大量实验表明,软阶段激励奖励函数能够借助最先进的 DRL 方法将收敛速度提高至多 46.9%。收敛平均奖励的提升幅度为 4.4%–15.5%,标准差的降低幅度为 21.9%–63.2%。在评估实验中,机械臂轨迹规划的成功率达到 99.6%。
引用
@article{arxiv.2009.12068,
title = {Deep Reinforcement Learning with a Stage Incentive Mechanism of Dense Reward for Robotic Trajectory Planning},
author = {Gang Peng and Jin Yang and Xinde Lia and Mohammad Omar Khyam},
journal= {arXiv preprint arXiv:2009.12068},
year = {2021}
}