中文

基于自适应 t-动量优化的模仿学习中业余数据异常值比例未知时的处理

机器学习 2021-08-03 v1

摘要

行为克隆(BC)在将人类技能安全、直接地迁移到机器人方面具有很高潜力。然而,人类操作者执行的演示常包含噪声或不完美行为,若不加处理会影响模仿者的效率。为使模仿者能有效从非完美演示中学习,我们提出采用鲁棒的 t-动量优化算法。该算法基于 Student's t 分布以应对重尾数据并减弱离群观测的影响。我们将 t-动量算法扩展为具有自适应与自动鲁棒性,并通过实验展示该算法如何用于对未知重尾程度的数据集生成鲁棒的 BC 模仿者。事实上,使用基于 t-动量的 Adam 优化器训练的模仿者,在两种不同机器人执行的操纵任务上对非完美演示表现出鲁棒性,并展现出在利用额外数据的同时降低非最优行为不利影响的能力。

关键词

引用

@article{arxiv.2108.00625,
  title  = {Adaptive t-Momentum-based Optimization for Unknown Ratio of Outliers in Amateur Data in Imitation Learning},
  author = {Wendyam Eric Lionel Ilboudo and Taisuke Kobayashi and Kenji Sugimoto},
  journal= {arXiv preprint arXiv:2108.00625},
  year   = {2021}
}

备注

7 pages, Accepted in IROS 2021, See video pitch with main result on https://youtu.be/FfW_moT1-wU