基于接触能量的事后经验优先级排序
机器人学
2024-02-26 v2 人工智能
摘要
具有稀疏奖励的多目标机器人操作任务对强化学习(RL)算法而言是困难的,因为收集成功经验的效率低下。近期算法如事后经验回放(HER)通过利用失败的轨迹并将期望目标替换为已达成状态之一,使得任何失败的轨迹都能作为对学习的贡献,从而加速学习。然而,HER 均匀地选取失败轨迹,并未考虑哪些轨迹对学习最有价值。本文针对这一问题,提出了一种新颖的方法——基于接触能量的优先级排序(CEBP),该方法利用机器人夹爪中的触觉传感器和物体位移,基于接触带来的丰富信息从回放缓冲区中选择样本。我们的优先级排序方案倾向于采样接触丰富的经验,这些经验可以说提供了最大量的信息。我们在各种稀疏奖励机器人任务上评估了我们提出的方法,并将其与最先进的方法进行了比较。我们表明,我们的方法在机器人操作任务上超越或与这些方法性能相当。最后,我们将通过本方法训练的策略部署到真实的 Franka 机器人上执行抓取-放置任务。我们观察到机器人能够成功完成任务。视频和代码公开于:https://erdiphd.github.io/HER_force
引用
@article{arxiv.2312.02677,
title = {Contact Energy Based Hindsight Experience Prioritization},
author = {Erdi Sayar and Zhenshan Bing and Carlo D'Eramo and Ozgur S. Oguz and Alois Knoll},
journal= {arXiv preprint arXiv:2312.02677},
year = {2024}
}