基于任务进度的高斯奖励与损失调整探索的机器人操作任务学习
机器人学
2021-11-22 v2
摘要
非结构化环境中的多步操作任务对机器人学习而言极具挑战。此类任务交织着高层推理与低层推理:高层推理包含为实现整体任务可达成之期望状态,低层推理决定何种动作将产生这些状态。我们提出一种无模型深度强化学习方法来学习多步操作任务。我们引入机器人操作网络(RoManNet),一种基于视觉的模型架构,以学习动作价值函数并预测操作动作候选。我们定义一种基于任务进度的高斯(TPG)奖励函数,根据导致成功运动基元并朝整体任务目标推进的动作来计算奖励。为平衡探索/利用之比,我们引入损失调整探索(LAE)策略,依据损失估计的玻尔兹曼分布从动作候选中确定动作。我们通过在仿真与真实世界中训练 RoManNet 学习若干具有挑战性的多步机器人操作任务,证明了方法的有效性。实验结果表明,我们的方法优于现有方法,并在成功率与动作效率方面达到最先进(state-of-the-art)性能。消融研究表明,TPG 与 LAE 尤其有益于如多积木堆叠等任务。代码见:https://github.com/skumra/romannet
引用
@article{arxiv.2103.01434,
title = {Learning Robotic Manipulation Tasks via Task Progress based Gaussian Reward and Loss Adjusted Exploration},
author = {Sulabh Kumra and Shirin Josh and Ferat Sahin},
journal= {arXiv preprint arXiv:2103.01434},
year = {2021}
}
备注
Accepted for publication in IEEE Robotics and Automation Letters (RA-L)