中文

面向数据高效直接策略搜索的自动先验选择贝叶斯优化

机器人学 2018-03-14 v2 人工智能 机器学习 神经与进化计算 机器学习

摘要

用于直接策略搜索的贝叶斯优化最有趣的特性之一是,它可以利用先验(例如,来自仿真或来自先前的任务)来加速机器人的学习。在本文中,我们对存在多个先验但事先不知道哪个先验最适合当前情况的场景感兴趣。我们通过引入一种新颖的采集函数来解决这个问题,该函数称为最可能期望改进(MLEI),它结合了先验的似然性和期望改进。我们在一个 5 自由度平面机械臂的迁移学习任务中,以及在一个可能受损的、必须在平地和楼梯上行走的 6 足机器人上评估了这种新的采集函数,其中先验对应于不同的楼梯和不同类型的损坏。我们的结果表明,即使当前情况与先验之间没有明显的匹配,MLEI 也能有效地识别并利用先验。

关键词

引用

@article{arxiv.1709.06919,
  title  = {Bayesian Optimization with Automatic Prior Selection for Data-Efficient Direct Policy Search},
  author = {Rémi Pautrat and Konstantinos Chatzilygeroudis and Jean-Baptiste Mouret},
  journal= {arXiv preprint arXiv:1709.06919},
  year   = {2018}
}

备注

Accepted at ICRA 2018; 8 pages, 4 figures, 1 algorithm; Video at https://youtu.be/xo8mUIZTvNE ; Spotlight ICRA presentation https://youtu.be/iiVaV-U6Kqo