中文

HTRON:基于重尾自适应强化算法的高效稀疏奖励户外导航

机器人学 2022-10-11 v2

摘要

我们提出了一种新方法来改进基于深度强化学习(deep reinforcement learning, DRL)的户外机器人导航系统的性能。大多数现有 DRL 方法基于精心设计的密集奖励函数,以学习环境中的高效行为。我们通过仅使用稀疏奖励(易于设计)规避此问题,并提出了一种用于户外导航的名为 HTRON 的新型自适应重尾强化(Heavy-Tailed Reinforce)算法。我们的主要思想是利用重尾策略参数化,在稀疏奖励设置中隐式地诱导探索。我们在三种不同户外场景中将 HTRON 与 Reinforce、PPO 和 TRPO 算法的性能进行比较:目标到达、障碍物规避和不平坦地形导航。我们观察到,与其他方法获得的导航策略相比,成功率平均提高 34.41%,到达目标所需平均时间步减少 15.15%,高程代价减少 24.9%。此外,我们证明我们的算法可直接迁移到 Clearpath Husky 机器人上,在真实场景中进行户外地形导航。

关键词

引用

@article{arxiv.2207.03694,
  title  = {HTRON:Efficient Outdoor Navigation with Sparse Rewards via Heavy Tailed Adaptive Reinforce Algorithm},
  author = {Kasun Weerakoon and Souradip Chakraborty and Nare Karapetyan and Adarsh Jagan Sathyamoorthy and Amrit Singh Bedi and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2207.03694},
  year   = {2022}
}