中文

贝叶斯扰动注入:灵活策略的鲁棒模仿学习

机器人学 2022-11-08 v3

摘要

需要人类从多个看似最优的动作中做出选择的场景十分常见,然而标准模仿学习往往无法捕捉这种行为。相反,过度依赖复现专家动作会导致策略缺乏灵活性和不稳定性,从而在应用中泛化能力差。为解决该问题,本文提出首个结合贝叶斯变分推断的模仿学习框架,用于学习灵活的非参数多动作策略,同时通过引入和优化扰动以创建更丰富的演示数据集,使策略对误差来源具有鲁棒性。这种组合方法迫使策略适应具有挑战性的情况,从而能够高效地学习稳定的多动作策略。我们使用UR3 6-DOF机械臂通过桌面清扫任务的仿真和真实机器人实验评估了所提方法的有效性。结果表明,通过提升灵活性与鲁棒性,学习性能与控制安全性均优于对比方法。

关键词

引用

@article{arxiv.2103.13623,
  title  = {Bayesian Disturbance Injection: Robust Imitation Learning of Flexible Policies},
  author = {Hanbit Oh and Hikaru Sasaki and Brendan Michael and Takamitsu Matsubara},
  journal= {arXiv preprint arXiv:2103.13623},
  year   = {2022}
}

备注

7 pages, Accepted by the 2021 International Conference on Robotics and Automation (ICRA 2021)