中文

用于稀疏奖励环境的回放缓冲中后见之明目标排序

机器学习 2021-10-29 v1

摘要

本文提出一种称为后见之明目标排序(HGR)的回放经验优先级方法,以克服后见之明经验回放(HER)基于均匀采样生成后见之明目标的局限。HGR以更高概率对具有较大时序差分(TD)误差的回合中所访问的状态采样,该误差被视为强化学习智能体可从经验中学习量的代理度量。对大TD误差的实际采样分两步执行:首先,根据回放缓冲中各经验的平均TD误差采样一个回合;然后,对该采样回合,从未来访问状态中以更高概率采样导致更大TD误差的后见之明目标。所提方法与深度确定性策略梯度(DDPG,一种离策略无模型actor-critic算法)结合,在四项具挑战性的模拟机器人操作任务上比无任何优先级方法显著更快加速学习。实证结果表明,HGR在所有任务上比先前方法更高效地利用样本。

关键词

引用

@article{arxiv.2110.15043,
  title  = {Hindsight Goal Ranking on Replay Buffer for Sparse Reward Environment},
  author = {Tung M. Luu and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2110.15043},
  year   = {2021}
}