中文

基于贝叶斯经验复用的多示范者学习

机器学习 2020-06-11 v1 神经与进化计算 机器人学 机器学习

摘要

从演示中学习(LfD)通过引入专家演示来提升学习智能体的探索效率。然而,演示数据常来自具有冲突目标的多个专家,难以在安全有效的在线设定中融入。我们在静态与动态优化设定下解决该问题:利用正态-逆伽马先验对源任务与目标任务函数的不确定性建模,其对应后验分别通过具有共享特征的贝叶斯神经网络从演示数据与目标数据中学习。我们利用该学到的信念导出一个二次规划问题,其解给出了专家模型上的概率分布。最后,我们提出贝叶斯经验复用(BERS)以依据该分布采样演示,并直接复用于新任务。我们展示了该方法在平滑函数静态优化及具有成本不确定性的高维供应链问题迁移学习中的有效性。

关键词

引用

@article{arxiv.2006.05725,
  title  = {Bayesian Experience Reuse for Learning from Multiple Demonstrators},
  author = {Michael Gimelfarb and Scott Sanner and Chi-Guhn Lee},
  journal= {arXiv preprint arXiv:2006.05725},
  year   = {2020}
}

备注

15 pages, 7 figures