中文

ARCHER:以激进奖励抵消后见经验回放中的偏差

机器学习 2018-09-10 v2 人工智能 机器学习

摘要

经验回放是解决深度强化学习(RL)中样本低效问题的重要技术,但由于回放缓冲区中成功经验比例过低,其难以从二值与稀疏奖励中学习。后见经验回放(HER)近期被提出以通过操纵不成功的转移来应对该困难,但在此过程中,HER 在回放缓冲区经验中引入了显著偏差,因而在样本效率上仅获得次优改进。本文对 HER 中偏差的来源进行分析,并提出一种简单有效的方法以抵消该偏差,从而最有效地利用 HER 所提供的样本效率。我们的方法受反事实推理启发,称为 ARCHER,它通过一种权衡扩展 HER,使得为后见经验计算的奖励在数值上大于真实奖励。我们在 DeepMind Control Suite 的两个连续控制环境——Reacher 与 Finger(模拟机械臂操作任务)——上验证我们的算法,并结合多种奖励函数、任务复杂度与目标采样策略。我们的实验一致表明,使用更激进的后见奖励来抵消偏差可提升样本效率,从而确立了 ARCHER 在有限计算预算的 RL 应用中的更大益处。

关键词

引用

@article{arxiv.1809.02070,
  title  = {ARCHER: Aggressive Rewards to Counter bias in Hindsight Experience Replay},
  author = {Sameera Lanka and Tianfu Wu},
  journal= {arXiv preprint arXiv:1809.02070},
  year   = {2018}
}

备注

8 pages