半马尔可夫模型中具有自适应前向模拟时间的机器人导航强化学习
机器人学
2023-07-06 v4 人工智能
摘要
深度强化学习(DRL)算法已被证明在机器人导航中有效,尤其在未知环境中,通过将感知输入直接映射为机器人控制命令。然而,大多数现有方法忽略了导航中的局部极小问题,因而无法处理复杂未知环境。本文中,我们提出首个由连续动作空间的半马尔可夫决策过程(SMDP)建模的基于 DRL 的导航方法,称为自适应前向模拟时间(AFST),以克服该问题。具体而言,我们降低了动作空间的维度,并通过修改分布式近端策略优化(DPPO)算法的 GAE 以更好地估计 SMDP 中的策略梯度,从而改进该指定 SMDP 问题的 DPPO 算法。在各种未知环境中的实验证明了 AFST 的有效性。
引用
@article{arxiv.2108.06161,
title = {Reinforcement Learning for Robot Navigation with Adaptive Forward Simulation Time (AFST) in a Semi-Markov Model},
author = {Yu'an Chen and Ruosong Ye and Ziyang Tao and Hongjian Liu and Guangda Chen and Jie Peng and Jun Ma and Yu Zhang and Jianmin Ji and Yanyong Zhang},
journal= {arXiv preprint arXiv:2108.06161},
year = {2023}
}