基于奖励的机器人操作策略学习环境状态
机器人学
2021-12-13 v1
摘要
训练机器人操作策略是机器人与人工智能领域中一个具有挑战性的开放问题。在本文中,我们提出了一种基于从图像任务成功分类器预测的奖励的新型紧凑状态表示。我们使用 Pepper 机器人在仿真中通过两种深度强化学习算法在抓取与抬起任务上的实验表明,我们所提出的状态表示使用我们的最佳策略可达到高达 97% 的任务成功率。
引用
@article{arxiv.2112.05621,
title = {Reward-Based Environment States for Robot Manipulation Policy Learning},
author = {Cédérick Mouliets and Isabelle Ferrané and Heriberto Cuayáhuitl},
journal= {arXiv preprint arXiv:2112.05621},
year = {2021}
}
备注
NeurIPS Workshop on Deployable Decision Making in Embodied Systems, 2021