中文

基于可达性行为先验的机器人移动操作学习

机器人学 2022-10-20 v3 人工智能 机器学习

摘要

移动操作(MM)系统是在非结构化真实环境中担任个人助理的理想候选。除其他挑战外,MM需要有效协调机器人的载体以执行既需移动又需操作的任务。强化学习(RL)有望赋予机器人自适应行为,但多数方法需要 prohibitively 大量的数据来学习有用的控制策略。本工作中,我们研究在 actor-critic RL 方法中集成机器人可达性先验,以加速 MM 中到达与取回任务的学习。具体而言,我们考虑最优基座放置及随后是否激活机械臂以到达6D目标的问题。为此,我们设计一种新颖的混合RL方法,联合处理离散与连续动作,借助 Gumbel-Softmax 重参数化。接下来,受经典方法启发,我们利用操作机器人工作空间的数据训练可达性先验。随后,我们推导出增强型混合RL(BHyRL),一种通过将 Q 函数建模为残差逼近器之和来学习的新颖算法。每当需学习新任务时,我们可迁移已学残差并学习 Q 函数中任务特定的分量,从而保持来自先验行为的任务结构。此外,我们发现用先验策略正则化目标策略可产生更具表现力的行为。我们在仿真中于难度递增的到达与取回任务上评估方法,并展示 BHyRL 相对于基线方法的优越性能。最后,我们将学到的 BHyRL 6D 取回策略零迁移至我们的 MM 机器人 TIAGo++。更多细节与代码发布请参考我们的项目站点:irosalab.com/rlmmbp

关键词

引用

@article{arxiv.2203.04051,
  title  = {Robot Learning of Mobile Manipulation with Reachability Behavior Priors},
  author = {Snehal Jauhri and Jan Peters and Georgia Chalvatzaki},
  journal= {arXiv preprint arXiv:2203.04051},
  year   = {2022}
}

备注

Accepted: RA-L & IROS 2022