中文

面向策略梯度的自适应经验选择

机器学习 2020-02-19 v1 机器学习 机器人学

摘要

策略梯度强化学习(RL)算法在连续控制等挑战性学习任务中取得了令人印象深刻的性能,但存在样本复杂度高的问题。经验回放是提高样本效率的常用方法,但使用过去轨迹的梯度估计量通常具有高方差。现有的经验回放采样策略(如均匀采样或优先经验回放)并未显式尝试控制梯度估计的方差。本文中,我们提出一种在线学习算法——自适应经验选择(AES),以自适应地学习一个显式最小化该方差的经验采样分布。利用遗憾最小化方法,AES 迭代更新经验采样分布以匹配假定具有最优方差的竞争者分布。针对样本非平稳性,我们提出一种动态(即时变)竞争者分布并给出其闭式解。我们证明 AES 是一种具有合理样本复杂度的低遗憾算法。在实证中,AES 已应用于深度确定性策略梯度和软 actor-critic 算法,并在 OpenAI Gym 库的 8 个连续控制任务上测试。我们的结果表明,相较于当前可用的策略梯度经验采样策略,AES 带来了显著改进的性能。

关键词

引用

@article{arxiv.2002.06946,
  title  = {Adaptive Experience Selection for Policy Gradient},
  author = {Saad Mohamad and Giovanni Montana},
  journal= {arXiv preprint arXiv:2002.06946},
  year   = {2020}
}