中文

机器人示教学习中的约束估计与无导数恢复

机器人学 2018-10-17 v3

摘要

从人类示教中学习可促进自动化,但存在风险,因为所学策略的执行可能导致碰撞及其他故障。当状态表示复杂时,通常无法添加显式约束以避免不安全状态。此外,在难以建模动力学的环境中(如抓取中的推动力学),执行所学策略时施加这些约束颇具挑战。本文提出无导数恢复(DFR),一种从示教中为每时间步系统静止的机器人操作任务生成鲁棒策略的两阶段方法。第一阶段,我们对监督者示教进行支撑估计,并将支撑视为对状态的隐式约束;还提出了针对序贯任务的时间变化修正。第二阶段,利用该支撑估计导出切换策略:在支撑内部采用所学策略,若机器人漂移过近则切换至恢复策略使其远离支撑边界。我们给出附加条件,在每时间步将状态差异以控制幅值线性界定,从而证明机器人使用恢复策略不会违反约束。MuJoCo 中的模拟推动任务表明 DFR 可减少 83% 碰撞;在使用 da Vinci 手术机器人与运动 Stewart 平台的物理线跟踪任务中,DFR 减少了 84% 碰撞。

关键词

引用

@article{arxiv.1801.10321,
  title  = {Constraint Estimation and Derivative-Free Recovery for Robot Learning from Demonstrations},
  author = {Jonathan Lee and Michael Laskey and Roy Fox and Ken Goldberg},
  journal= {arXiv preprint arXiv:1801.10321},
  year   = {2018}
}