结合 Kronecker 积近似曲率的回顾经验回放
机器学习
2020-10-14 v1
摘要
回顾经验回放(HER)是解决稀疏奖励环境下强化学习任务的高效算法之一。但由于样本效率较低且收敛较慢,HER 未能有效发挥作用。自然梯度通过更好地收敛模型参数解决了这些挑战,它避免采取使训练性能崩溃的坏动作。然而,神经网络中的参数更新需要昂贵的计算,从而增加了训练时间。我们提出的方法以更好的样本效率、更快的收敛和更高的成功率解决了上述挑战。DDPG 的一个常见失败模式是学到的 Q 函数开始严重高估 Q 值,进而导致策略崩溃,因为它利用了 Q 函数中的误差。我们通过将双延迟深度确定性策略梯度(TD3)纳入 HER 来解决此问题。TD3 学习两个而非一个 Q 函数,并对目标动作添加噪声,使策略更难利用 Q 函数误差。实验借助 OpenAI 的 Mujoco 环境完成。在这些环境上的结果表明,我们的算法(TDHER+KFAC)在大多数场景中表现更优。
引用
@article{arxiv.2010.06142,
title = {Hindsight Experience Replay with Kronecker Product Approximate Curvature},
author = {Dhuruva Priyan G M and Abhik Singla and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:2010.06142},
year = {2020}
}
备注
arXiv admin note: text overlap with arXiv:1708.05144 by other authors