中文

稀疏强化学习中的样本效率:否则全额退款

机器学习 2020-08-31 v1 人工智能 机器学习

摘要

稀疏奖励在强化学习中呈现出难题,并且在具有复杂动态的某些领域(如真实世界机器人)中可能是不可避免的。后见之明经验回放(Hindsight Experience Replay,HER)是一种近期的回放记忆发展,它通过修改记忆以将其显示为成功(即使它们可能并非如此)来允许智能体在稀疏设置中学习。虽然经验上 HER 已显示出一些成功,但它未提供关于从智能体回放记忆中抽取样本构成的保证。这可能导致小批量仅包含零值奖励的记忆,或智能体学习到完成 HER 调整目标而非实际目标的不期望策略。在本文中,我们引入否则全额退款(Or Your Money Back,OYMB),一种设计用于与 HER 协同工作的回放记忆采样器。OYMB 通过提供对智能体回放记忆的直接接口来改善稀疏设置中的训练效率,该接口允许控制小批量构成,以及一种优先在实际目标记忆之前查找 HER 调整记忆的优先查找方案。我们在三个独特环境中的五项任务上测试我们的方法。我们的结果表明,将 HER 与 OYMB 结合使用优于单独使用 HER,并导致智能体更快地学会完成实际目标。

关键词

引用

@article{arxiv.2008.12693,
  title  = {Sample Efficiency in Sparse Reinforcement Learning: Or Your Money Back},
  author = {Trevor A. McInroe},
  journal= {arXiv preprint arXiv:2008.12693},
  year   = {2020}
}