中文

基于虚拟目标优先级排序的偏差削减后见之明经验回放

机器学习 2021-03-09 v5 人工智能 机器学习

摘要

后见之明经验回放(HER)是一种针对稀疏奖励函数的多目标强化学习算法。该算法将每一回合中已实现的替代(虚拟)目标视为成功,从而把每次失败都当作一次成功。虚拟目标是随机选取的,而不考虑哪些对智能体最具指导意义。本文提出对现有 HER 算法的两项改进。首先,我们对虚拟目标进行优先级排序,使智能体能从中学习更有价值的信息。我们称此性质为虚拟目标的指导性,并通过一种启发式度量来定义,该度量表达了智能体从该虚拟目标向实际目标泛化的能力。其次,我们通过移除误导性样本来减少 HER 中已有的偏差。为测试我们的算法,我们构建了两个具有稀疏奖励函数的挑战性环境。在两种环境中的实证结果均表明,与原始 HER 算法相比,最终成功率和样本效率均有大幅提升。展示实验结果的视频可在 https://youtu.be/3cZwfK8Nfps 获取。

关键词

引用

@article{arxiv.1905.05498,
  title  = {Bias-Reduced Hindsight Experience Replay with Virtual Goal Prioritization},
  author = {Binyamin Manela and Armin Biess},
  journal= {arXiv preprint arXiv:1905.05498},
  year   = {2021}
}