基于 Frank-Wolfe 算法的学徒学习
机器学习
2019-11-21 v2 机器学习
摘要
我们考察 Frank-Wolfe(FW)算法在学徒学习(Apprenticeship Learning, AL)中的应用。在此设定下,给定一个无显式奖励函数的马尔可夫决策过程(Markov Decision Process, MDP)。相反,我们观察到依据某策略行事的专家,目标是找到特征期望与专家策略最为接近的策略。我们将此问题形式化为:求专家特征期望在特征期望多面体(即 MDP 中所有确定性策略的特征期望的凸包)上的投影。我们表明该形式化等价于 AL 目标,且用 FW 算法求解此问题等价于 Abbeel 与 Ng(2004)著名的投影法。这一洞见使我们能借助凸优化文献中的工具分析 AL,并推导更紧的 AL 收敛界。具体而言,我们展示了基于“远离步”(away steps)的 FW 变体在应用于 AL 时取得线性收敛速率,且 FW 算法的随机版本可用于避免对特征期望的精确估计。我们还通过实验表明该版本优于 FW 基线。据我们所知,这是首个展示 AL 线性收敛速率的工作。
引用
@article{arxiv.1911.01679,
title = {Apprenticeship Learning via Frank-Wolfe},
author = {Tom Zahavy and Alon Cohen and Haim Kaplan and Yishay Mansour},
journal= {arXiv preprint arXiv:1911.01679},
year = {2019}
}