中文

凸函数差规划在含专家数据的控制中的应用

最优化与控制 2016-09-06 v2 机器学习 机器学习

摘要

本文报告了凸函数差(DC)规划在从演示中学习(LfD)和利用专家数据的强化学习(RL)中的应用。这之所以成为可能,是因为作为许多RL和LfD算法核心的最优贝尔曼残差(OBR)的范数是DC的。通过在通用马尔可夫决策过程(MDP,称为Garnets)上的实验,在两种特定算法上展示了性能的改进,这两种算法分别是用于学徒学习的奖励正则化分类(RCAL)和利用专家演示的强化学习(RLED)。

关键词

引用

@article{arxiv.1606.01128,
  title  = {Difference of Convex Functions Programming Applied to Control with Expert Data},
  author = {Bilal Piot and Matthieu Geist and Olivier Pietquin},
  journal= {arXiv preprint arXiv:1606.01128},
  year   = {2016}
}