中文

用于高效多目标强化学习的偏差缩减多步后见经验回放

机器学习 2022-09-27 v3 人工智能 机器人学

摘要

多目标强化学习广泛应用于规划与机器人操作中。多目标强化学习的两大挑战是稀疏奖励与样本低效。后见经验回放(Hindsight Experience Replay, HER)旨在通过目标重标来解决这两个挑战。然而,HER 相关工作仍需要数百万样本与巨大计算量。本文提出多步后见经验回放(Multi-step Hindsight Experience Replay, MHER),基于 nn 步重标引入多步重标回报以提升样本效率。尽管 nn 步重标具有优势,我们理论上与实验上证明由 nn 步重标引入的离策 nn 步偏差可能导致在许多环境中性能不佳。为解决上述问题,提出两种偏差缩减的 MHER 算法:MHER(λ\lambda) 与基于模型的 MHER(Model-based MHER, MMHER)。MHER(λ\lambda) 利用 λ\lambda 回报,而 MMHER 受益于基于模型的值扩展。在众多多目标机器人任务上的实验结果表明,我们的方案能成功缓解离策 nn 步偏差,并在仅比 HER 增加极少额外计算的情况下,取得显著高于 HER 与课程引导 HER 的样本效率。

关键词

引用

@article{arxiv.2102.12962,
  title  = {Bias-reduced Multi-step Hindsight Experience Replay for Efficient Multi-goal Reinforcement Learning},
  author = {Rui Yang and Jiafei Lyu and Yu Yang and Jiangpeng Yan and Feng Luo and Dijun Luo and Lanqing Li and Xiu Li},
  journal= {arXiv preprint arXiv:2102.12962},
  year   = {2022}
}

备注

20pages, 8 figures