面向稀疏反馈复杂操作任务的深度强化学习
机器学习
2020-01-14 v1 机器学习
摘要
从稀疏反馈中学习最优策略是强化学习中已知的挑战。Hindsight Experience Replay(HER)是一种多目标强化学习算法,用于解决此类任务。该算法将 episode 中出现的每次失败视为某个已实现的替代(虚拟)目标的成功,然后从该虚拟目标泛化到真实目标。HER 存在已知缺陷且局限于相对简单的任务。本论文中,我们提出三种基于现有 HER 算法、可提升其性能的算法。首先,我们对虚拟目标进行优先级排序,智能体从中可学到更有价值的信息。我们称此性质为虚拟目标的“指导性(instructiveness)”,并用启发式度量定义它,该度量表达智能体从该虚拟目标向实际目标泛化的能力。其次,我们设计了一个过滤过程,检测并移除可能在学习过程中引发偏差的误导性样本。最后,我们通过结合 HER 的课程学习形式,实现了复杂、序列化任务的学习。我们称此算法为 Curriculum HER。为测试我们的算法,我们构建了三个具有稀疏奖励函数的挑战性操作环境。每个环境有三个复杂度等级。我们的经验结果表明,与原始 HER 算法相比,最终成功率和样本效率均有大幅提升。
引用
@article{arxiv.2001.03877,
title = {Deep Reinforcement Learning for Complex Manipulation Tasks with Sparse Feedback},
author = {Binyamin Manela},
journal= {arXiv preprint arXiv:2001.03877},
year = {2020}
}
备注
A thesis submitted in fulfillment of the requirements for the degree of Master of Science in the department of Industrial Engineering and Management at Ben-Gurion University of the Negev