基于能量的后见之明经验优先级排序
机器学习
2020-05-26 v5 人工智能
机器学习
摘要
在后见之明经验回放(HER)中,强化学习智能体通过将其所达成的任何结果视为虚拟目标来进行训练。然而,在先前的工作中,经验是被随机回放的,没有考虑哪一回合可能对学习最有价值。在本文中,我们开发了一个基于能量的框架,用于在机器人操作任务中对后见之明经验进行优先级排序。我们的方法受到物理学中功-能原理的启发。我们将轨迹能量函数定义为目标物体沿轨迹的转移能量之和。我们假设,回放具有高轨迹能量的回合对于机器人学中的强化学习更为有效。为验证我们的假设,我们设计了一个基于目标状态轨迹能量的后见之明经验优先级排序框架。该轨迹能量函数考虑了势能、动能和转动能。我们在仿真中的四个具有挑战性的机器人操作任务上评估了我们的基于能量的优先级排序(EBP)方法。我们的实证结果表明,我们所提出的方法在所有四个任务上的性能和样本效率均超越了最先进的方法,且不增加计算时间。展示实验结果的视频可在 https://youtu.be/jtsF2tTeUGQ 获取。
引用
@article{arxiv.1810.01363,
title = {Energy-Based Hindsight Experience Prioritization},
author = {Rui Zhao and Volker Tresp},
journal= {arXiv preprint arXiv:1810.01363},
year = {2020}
}
备注
Published in Conference on Robot Learning (CoRL 2018) as oral presentation (7%), Zurich, Switzerland