软后见之明经验回放
人工智能
2020-02-07 v1 机器人学
摘要
在稀疏奖励环境中高效学习是深度强化学习(DRL)中最重要的挑战之一。在连续DRL环境(如机械臂控制)中,后见之明经验回放(HER)已被证明是一种有效解决方案。然而,由于确定性方法的脆弱性,HER及其变体通常面临稳定性与收敛性的重大挑战,这显著影响了最终性能。这一挑战严重限制了此类方法在复杂真实世界领域的适用性。为应对该挑战,本文中我们提出软后见之明经验回放(SHER),一种基于HER和最大熵强化学习(MERL)的新方法,结合了失败经验重用与最大熵概率推断模型。我们在具有稀疏奖励的Open AI机器人操作任务上评估SHER。实验结果表明,与HER及其变体相比,我们所提SHER达到了最先进(SOTA)性能,尤其在困难的HandManipulation任务中。此外,我们的SHER方法更稳定,在不同随机种子下取得了非常相近的性能。
引用
@article{arxiv.2002.02089,
title = {Soft Hindsight Experience Replay},
author = {Qiwei He and Liansheng Zhuang and Houqiang Li},
journal= {arXiv preprint arXiv:2002.02089},
year = {2020}
}
备注
7 pages, 5 figures, 1 table, submitted to IJCAI2020