从场景视觉观测与前一动作 Q 值预测中学习多步机器人操作策略
机器人学
2022-02-24 v1
摘要
本工作中,我们关注涉及长程规划并考虑进展逆转的多步操作任务。此类任务交织着由可实现以完成整体任务的期望状态构成的高层推理,以及决定何种动作将产生这些状态的低层推理。我们提出一种样本高效的前一动作条件机器人操作网络(PAC-RoManNet),从场景视觉观测与前一动作的动作值预测中学习动作值函数并预测操作动作候选。我们定义基于任务进度的高斯(TPG)奖励函数,其基于导向成功运动基元及朝向整体任务目标的进展的动作计算奖励。为平衡探索/利用之比,我们引入损失调整探索(LAE)策略,依据损失估计的 Boltzmann 分布从动作候选中确定动作。我们通过在仿真与真实世界中训练 PAC-RoManNet 学习若干具挑战性的多步机器人操作任务来展示方法有效性。实验结果表明我们的方法优于现有方法,并在成功率与动作效率上达到 SOTA 性能。消融研究显示出 TPG 与 LAE 尤其有益于如多积木堆叠等任务。在 Ravens-10 基准任务上的附加实验暗示所提 PAC-RoManNet 具有良好的泛化性。
引用
@article{arxiv.2202.11280,
title = {Learning Multi-step Robotic Manipulation Policies from Visual Observation of Scene and Q-value Predictions of Previous Action},
author = {Sulabh Kumra and Shirin Joshi and Ferat Sahin},
journal= {arXiv preprint arXiv:2202.11280},
year = {2022}
}
备注
7 pages, 3 figures, IEEE Conference on Robotics and Automation (ICRA) 2022. arXiv admin note: substantial text overlap with arXiv:2103.01434