贝叶斯扰动注入:用于机器人操作的灵活策略的鲁棒模仿学习
机器人学
2022-11-08 v1
摘要
人类在执行任务时表现出多种有趣的行为特征,例如在看似等价的最优动作间进行选择、偏离最优轨迹时执行恢复动作,或根据感知到的风险调节动作。然而,试图通过人类演示观察教机器人执行相同任务的模仿学习,往往无法捕捉此类行为。具体而言,常用学习算法在学习假设(如单一最优动作)与实际人类行为(如多个最优动作)之间存在固有矛盾,从而限制了机器人的泛化性、适用性与演示可行性。为此,本文提出以利用人类行为特征为重心设计模仿学习算法,从而体现捕捉并利用演示者实际行为特征的原则。本文提出首个模仿学习框架——贝叶斯扰动注入(BDI),它通过融合模型灵活性、鲁棒化与风险敏感性来刻画人类行为特征。贝叶斯推断用于学习灵活的非参数多动作策略,同时通过注入风险敏感扰动使策略鲁棒化以诱发人类恢复动作,并确保演示可行性。我们的方法通过风险敏感仿真与使用 UR5e 6-DOF 机械臂的真实机器人实验(如桌面清扫任务、轴对准任务与轴插入任务)进行评估,以证明对行为的改进刻画。结果表明,通过提升灵活性、鲁棒性以及演示可行性,任务性能得到显著改善。
引用
@article{arxiv.2211.03393,
title = {Bayesian Disturbance Injection: Robust Imitation Learning of Flexible Policies for Robot Manipulation},
author = {Hanbit Oh and Hikaru Sasaki and Brendan Michael and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2211.03393},
year = {2022}
}
备注
69 pages, 9 figures, accepted by Elsevier Neural Networks - Journal