中文

面向全身移动操作的因果策略梯度

机器人学 2023-09-29 v4 人工智能 机器学习

摘要

开发下一代家用机器人助手需要结合移动与交互能力,这通常被称为移动操作(MoMa)。MoMa任务因机器人动作空间庞大以及任务常见的多目标特性(例如高效到达目标的同时避开障碍物)而十分困难。当前方法常将任务割裂为无操作的自然导航与无移动的固定操作,通过人工将动作空间的部分匹配到MoMa子目标(例如为移动目标学习底座动作、为操作目标学习机械臂动作)。该方案阻碍了移动与交互自由度的同时组合,且需要人类领域知识来划分动作空间并将动作部分匹配到子目标。本文提出Causal MoMa,一种用于训练典型MoMa任务策略的新强化学习框架,它利用机器人动作空间中最有利的子空间来处理各个子目标。Causal MoMa自动发现动作与奖励函数各项之间的因果依赖,并通过因果策略梯度利用这些依赖,与先前最先进的强化学习算法相比降低了梯度方差,从而改善收敛与结果。我们在三类仿真机器人上的不同MoMa任务中评估了Causal MoMa的性能,并证明可将仿真中训练的策略直接迁移至真实机器人,其智能体能够在同时协同控制全身(底座、机械臂与头部)的情况下跟随移动目标并对动态障碍物作出反应。更多信息见 https://sites.google.com/view/causal-moma。

关键词

引用

@article{arxiv.2305.04866,
  title  = {Causal Policy Gradient for Whole-Body Mobile Manipulation},
  author = {Jiaheng Hu and Peter Stone and Roberto Martín-Martín},
  journal= {arXiv preprint arXiv:2305.04866},
  year   = {2023}
}