凸函数差规划在含专家数据的控制中的应用
最优化与控制
2016-09-06 v2 机器学习
机器学习
摘要
本文报告了凸函数差(DC)规划在从演示中学习(LfD)和利用专家数据的强化学习(RL)中的应用。这之所以成为可能,是因为作为许多RL和LfD算法核心的最优贝尔曼残差(OBR)的范数是DC的。通过在通用马尔可夫决策过程(MDP,称为Garnets)上的实验,在两种特定算法上展示了性能的改进,这两种算法分别是用于学徒学习的奖励正则化分类(RCAL)和利用专家演示的强化学习(RLED)。
引用
@article{arxiv.1606.01128,
title = {Difference of Convex Functions Programming Applied to Control with Expert Data},
author = {Bilal Piot and Matthieu Geist and Olivier Pietquin},
journal= {arXiv preprint arXiv:1606.01128},
year = {2016}
}