通过重尾策略处理连续控制机器人中的稀疏奖励问题
机器学习
2022-06-14 v1 机器人学
系统与控制
系统与控制
摘要
在本文中,我们提出了一种新颖的重尾随机策略梯度(HT-PSG)算法,以应对连续控制问题中稀疏奖励带来的挑战。稀疏奖励在操纵与导航等连续控制机器人任务中十分常见,并且由于状态空间上价值函数的非平凡估计,使得学习问题变得困难。这要求针对稀疏奖励环境进行奖励塑形或依赖专家演示。然而,获取高质量演示的成本相当高昂,有时甚至不可能。我们提出了一种重尾策略参数化方法,并结合改进的基于动量的策略梯度跟踪方案(HT-SPG),以赋予算法稳定的探索行为。所提算法无需访问专家演示。我们在具有稀疏奖励的各类连续控制基准任务上测试了 HT-SPG 的性能,例如 OpenAI Gym 中的 1D Mario、Pathological Mountain Car、Sparse Pendulum,以及 Sparse MuJoCo 环境(Hopper-v2)。我们展示了在所有任务中高平均累积奖励方面的一致性能提升。HT-SPG 还以最少样本数展现了更快的收敛速度,从而凸显了我们提出算法的样本效率。
引用
@article{arxiv.2206.05652,
title = {Dealing with Sparse Rewards in Continuous Control Robotics via Heavy-Tailed Policies},
author = {Souradip Chakraborty and Amrit Singh Bedi and Alec Koppel and Pratap Tokekar and Dinesh Manocha},
journal= {arXiv preprint arXiv:2206.05652},
year = {2022}
}