中文

MRHER:基于模型的接力式后见之明经验回放用于稀疏奖励序贯物体操纵任务

机器人学 2024-06-24 v2 人工智能

摘要

稀疏奖励对目标条件强化学习(RL)实现高样本效率构成重大挑战。具体而言,在序贯操纵任务中,智能体在成功完成整个操纵任务前只接收到失败奖励,导致样本效率低下。为解决此问题并提升样本效率,我们提出一种新颖的基于模型的 RL 框架,称为基于模型的接力式后见之明经验回放(MRHER)。MRHER 将连续任务分解为复杂度递增的子任务,并利用前一子任务引导后续子任务的学习。不同于在每个子任务中使用后见之明经验回放(HER),我们设计了一种新的鲁棒基于模型的重标方法,称为前瞻重标(FR)。FR 预测后见之明状态的未来轨迹,并将期望目标重标为虚拟未来轨迹上已实现的目标。通过引入 FR,MRHER 有效从历史经验中捕获更多信息,从而提升样本效率,尤其在物体操纵环境中。实验结果表明,MRHER 在基准任务中展现出最先进的样本效率,在 FetchPush-v1 环境与 FetchPickandPlace-v1 环境中分别超越 RHER 13.79% 与 14.29%。

关键词

引用

@article{arxiv.2306.16061,
  title  = {MRHER: Model-based Relay Hindsight Experience Replay for Sequential Object Manipulation Tasks with Sparse Rewards},
  author = {Yuming Huang and Bin Ren and Ziming Xu and Lianghong Wu},
  journal= {arXiv preprint arXiv:2306.16061},
  year   = {2024}
}