中文

DropoutDAgger:一种面向安全模仿学习的贝叶斯方法

人工智能 2017-09-20 v1 机器人学

摘要

尽管模仿学习在机器人领域正成为常见实践,但该方法常受数据不匹配与误差累积的困扰。DAgger 是一种迭代算法,通过持续聚合来自专家策略与新策略的训练数据来解决这些问题,但未考虑安全性的影响。我们提出 DAgger 的概率扩展,该扩展利用新策略针对给定观测提供的动作分布。我们称该方法为 DropoutDAgger,它使用 dropout 将新策略训练为贝叶斯神经网络,从而提供对其置信度的洞察。利用新策略动作的分布,我们估计出相对于专家动作的安全概率度量,并加以调整以平衡探索与利用。该方法在 MuJoCo HalfCheetah 和一个简单驾驶实验中进行了评估,结果表明,与其他 DAgger 变体和经典模仿学习相比,其性能与安全性均有所提升。

关键词

引用

@article{arxiv.1709.06166,
  title  = {DropoutDAgger: A Bayesian Approach to Safe Imitation Learning},
  author = {Kunal Menda and Katherine Driggs-Campbell and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:1709.06166},
  year   = {2017}
}